音视频联合生成一直有个绕不开的难题:画面和声音要同时优化,但两者的评价标准完全不同。画面看清晰度、连贯性,声音看节奏、音质。如果只用一个奖励信号去调,很容易顾此失彼。

这篇论文提出了一个叫自适应奖励路由的方法,专门解决多奖励优化在音视频扩散模型里的分配问题。

打开网易新闻 查看精彩图片

核心思路:让奖励动态分配

论文全称是《Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL》,从标题能看出三个关键信息:

  • 面向的是音视频联合扩散任务
  • 用的是多奖励优化框架
  • 底层方法基于前向过程的强化学习

所谓自适应奖励路由,可以理解为:在生成过程的不同阶段,系统会动态决定该侧重画面奖励还是声音奖励,而不是从头到尾用一套固定权重。

为什么值得关注

音视频联合生成是扩散模型里相对新的方向,多奖励之间的平衡问题此前缺少针对性的解法。这篇论文把强化学习里的前向过程思路引入进来,给多目标优化提供了一个可操作的框架。

论文已在 Hugging Face 的论文页面公开,具体实现细节和实验数据可查阅原文。