GRPO 统一更新整条样本,ViPO 在样本内部重新分配强度。
PSM 结构:视觉偏好提取与分配图生成流程。
视频时序结果:车辆和人物动作中的跨帧比较。

视觉生成模型进入强化学习阶段后,一个老问题越来越明显:Reward 可以判断整张图好不好,却很难告诉模型究竟哪里出了错。

脸部、手指、文字和运动结构的错误往往集中在局部。标准 GRPO 通常给每个样本一个标量优势,更新压力铺向完整图像或视频。结果可能是,为修两根手指,连正确背景也被改动;某几帧动作崩坏,又被整体画面质量掩盖。

ViPO 给出的方案,是把“总分”重新展开。

标量反馈遇上结构化内容

标量反馈遇上结构化内容

ViPO 全称 Visual Preference Policy Optimization。它保留 GRPO 的样本组比较,再增加 PSM,将标量 advantage 转为空间和时间敏感的优势图。

打开网易新闻 查看精彩图片

PSM 使用预训练视觉 backbone 提取感知结构,不需要新的像素级人工标注。它生成的 allocation map 说明主体、关键局部和运动位置的重要程度。

这张图不负责决定哪个样本更好。GRPO 已经给出方向,PSM 只负责安排梯度主要落在哪里。ViPO 因而把分配图作用在 advantage 层,避免直接改写 Reward 排序。

打开网易新闻 查看精彩图片

图像和视频都得到验证

图像和视频都得到验证

在 FLUX.1-dev 图像后训练中,ViPO 的 HPSv2.1 达到 0.3321,高于原始模型和 DanceGRPO。PickScore、ImageReward 等域外指标也保持改善,没有只针对一个评分器优化。

视频测试使用 Wan2.1-T2V-14B-480P。视觉质量、运动质量与 VBench 综合指标均有提升。定性样例中,重点差异出现在动作区域、主体形态和跨帧一致性,而不是简单增加锐度或颜色饱和度。

打开网易新闻 查看精彩图片

研究还设置了只鼓励“更红”的极端 Reward。标量方法更容易把整幅内容推向红色,并损伤角色身份;ViPO 的局部分配减弱了这种全局扩散。

奖励模型之外的新接口

奖励模型之外的新接口

视觉生成后训练过去常把精力集中在 Reward Model:评分器是否更大、数据是否更多、对齐是否更准。ViPO 指向另一层瓶颈。即便 Reward 已捕捉到局部质量,压成标量再送进优化器,细节仍可能在接口处丢失。

这不意味着 PSM 永远能找对区域。它依赖预训练视觉表征,也没有纠正错误价值目标的能力。视频动作还涉及对象轨迹和长期依赖,帧级热图只是起点。

一条新的后训练分工

一条新的后训练分工

过去改进视觉生成强化学习,注意力常集中在“怎样得到更好的分数”。ViPO 把视线移到分数之后:即使 Reward 暂时不变,更新信号怎样进入有空间和时间结构的内容,也会决定模型学到什么。

这意味着视觉后训练可能出现更清楚的模块分工。Reward Model 负责总体偏好,组内优化负责相对方向,PSM 一类模块负责空间时序 credit assignment。不同环节可以分别审计,而不必把评分、定位和梯度全部塞进一个黑箱。

域外结果在这里比单项涨分更关键。若模型只在被优化的 HPSv2.1 上提高,却在 PickScore、ImageReward 或 VBench 上退化,结构化分配可能仍在放大局部偏好。论文同时观察域内与 OOD 指标,就是为了避免把“更会讨好一位裁判”写成整体能力提升。

从热图走向真实梯度还有门槛

从热图走向真实梯度还有门槛

PSM 依赖预训练视觉 backbone。它能看到主体,不代表一定能看到文本拼写、细微手指结构或一段动作背后的因果关系。不同 backbone 对语义、纹理和边界的敏感程度也不同。

图像特征图与生成模型 latent 还需要对齐。空间缩放、视频抽帧和时间插值都会影响压力最终落在哪一层、哪一帧。视觉上合理的热区,如果与生成变量的责任范围错位,仍可能产生误更新。

Redness 实验给这类风险提供了一个很直观的压力测试。错误 Reward 仍会把模型往错误方向推,结构化方法只能减少无差别破坏。它像给更新装上方向盘,却没有替系统决定目的地。

因此,ViPO 更适合被理解为视觉 RL 的新接口,而不是一个独立解决所有对齐问题的模块。Reward 是否可信、PSM 是否看对重点、梯度是否落到真正负责的变量上,三道检查缺一不可。

训练日志应同时保存 PSM 热图与实际梯度分布。只有两者在空间和时间上大致一致,才能确认优势信号真的落到了预期位置。

但方向已经变得清楚:视觉内容的反馈不必永远以一个数字结束。模型若要修好局部问题,训练信号也需要知道“重点”在哪里。

论文原文与引用

论文原文与引用

本文解读的论文原题为 *Seeing What Matters: Visual Preference Policy Optimization for Visual Generation*。

- 发表信息:CVPR 2026;arXiv:2511.18719v4

Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, and Xuelong Li. “Seeing What Matters: Visual Preference Policy Optimization for Visual Gneration.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026.