Akira
TA的勋章
训练过程中,怎样判断视觉特征是否清晰
从 SFT 到 DPO:视频生成模型后训练为何变成系统工程
当奖励模型也会误判,视频生成后训练该信什么
视觉生成强化学习开始“看重点”:ViPO 如何重做奖励分配