来源:市场资讯

(来源:PaperWeekly)

采用 Gemini-2.5/3.1-Pro API,通过“结构化剧本+证据链”生成 10 万条训练数据,VITA-1.5-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B 模型在 OmniVideo-Test、Video-MME、Video-MME-v2、Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 音视频理解基准上均取得显著性能提升。

打开网易新闻 查看精彩图片

代码:https://github.com/MiG-NJU/OmniVideo-100K

数据:https://huggingface.co/datasets/MiG-NJU/OmniVideo-100K

为什么多模态大模型已经能够看懂画面、识别声音,却依然经常答错一些看似简单的问题?

例如,一个女孩在视频前半段说:“希望能抽到拿可乐瓶的那个玩偶。”几分钟后,她打开盲盒,看到玩偶手里拿着可乐瓶,兴奋地说:“I love it.”

如果问模型:“她为什么这么开心?”正确回答并不只是识别一句话或一帧画面,而是需要把前后的语音、人物和事件关联起来,建立跨时间的因果关系。

然而,当前大量音视频训练数据仍采用“视频→描述→问答”的自动生成方式。视频被切成多个片段,音频和视觉信息分别描述,再直接生成问答。

这个过程中,人物身份、声音来源以及跨时间事件之间的联系往往被打断,导致模型学到的是零散片段,而不是完整故事。

针对这一问题,南京大学与中科院自动化所提出 OmniVideo-100K。

该工作通过“结构化剧本+证据链”的方式自动构建高质量音视频训练数据:首先将视频整理为包含角色、时间戳、语音、声音和视觉描述的结构化剧本,再从剧本中挖掘跨片段、跨模态的证据链,最终生成真正依赖音视频协同推理的问答样本。

最终,团队利用 Gemini-2.5/3.1-Pro API 构建了 10 万条音视频问答训练数据 OmniVideo-100K,以及一个人工校验测试集 OmniVideo-Test。

使用该数据微调 VITA-1.5-7B、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B 后,三个模型在 OmniVideo-Test 上分别提升 20.59%、17.82% 和 13.86%。

在 Video-MME、Video-MME-v2、Daily-Omni、OmniVdideoBench、JointAVBench、FutureOmni 等外部基准上,最高也取得 12.64% 的泛化提升。

打开网易新闻 查看精彩图片

音视频理解的短板,不在“看不见”或“听不见”

现有自动化音视频 QA 数据构建,大多遵循一种直接的“视频-描述-问答”流程:先把长视频切成短片段,再分别生成视觉描述和音频描述,最后把这些文本交给大语言模型合成问答。

这个流程效率很高,也足够适合生成大量基础样本。但当任务从“画面里有什么”“谁说了什么”走向“为什么会这样”“前后发生了什么关系”时,它的问题会变得明显。

  • 音画关联容易断裂。声音被转成一段文本,画面被转成另一段文本,如果没有明确的说话人和时间对齐,模型很难知道某句话到底来自画面中的谁。

  • 同一实体可能在不同片段中被反复改名。前一段叫“白衣女子”,后一段又叫“短发女孩”,大语言模型读到的不是连贯叙事,而是一组松散片段。

  • 问题会停留在局部事件。如果直接从很长的片段描述里生成 QA,模型往往选择眼前最显眼的信息出题,而不是主动寻找跨时间、跨模态的深层联系。

换句话说,传统流程并不是缺少描述,而是缺少“追踪”。它可以告诉模型某个片段里出现了什么,却不一定能告诉模型:谁在什么时候说了什么,这句话后来如何被画面印证,又如何成为回答问题的证据。

打开网易新闻 查看精彩图片

先把视频写成剧本:给模型一条可追踪的时间线

OmniVideo-100K 的第一步,是把视频转成结构化剧本。这里的“剧本”不是文学化改写,而是一种中间表示:它把全局摘要、主要实体列表、分段时间戳、说话人标注、非语音声音和视觉描述统一放在同一套结构里。

打开网易新闻 查看精彩图片

〓图1. OmniVideo-100K 的自动化音视频 QA 生成流水线。

这个设计中最关键的是“实体锚定”。在正式生成分段描述之前,模型会先识别视频中的主要实体,例如人物、动物、关键物体,并为它们分配稳定的描述性标识。之后无论视频被切成多少段,后续描述都要沿用这份实体表。

这样做的价值很直接:如果一个角色在第 1 分钟说过一句话,又在第 4 分钟做出某个动作,系统能够持续把两处信息绑定到同一个实体上,而不是把它们误当成两个不同的人。

除了实体一致性,流水线还显式处理音画关联。语音会带有起止时间戳,并进一步绑定说话人;非语音声音和音乐也会被记录;视觉描述则围绕环境、人物与物体、动作与交互、镜头变化等维度展开。

最终得到的不是一堆 caption,而是一份可以被检索、对齐和推理的音视频叙事文本。

这一步让后续生成不再依赖模型对长文本的“泛读能力”。视频被拆开了,但人物、声音和事件没有被拆散。

打开网易新闻 查看精彩图片

不是直接出题,而是先挖证据链

有了剧本以后,OmniVideo-100K 并没有马上让模型生成问题。论文中真正影响数据质量的第二个机制,是 Clue-Guided QA Generation:先找线索,再围绕线索出题。

具体来说,系统会先让大语言模型扫描完整剧本,挖掘服务于特定任务的跨片段、多模态线索,并记录对应时间戳。例如,一个因果推理问题可能需要同时用到前半段的语音线索、后半段的动作线索,以及两者之间的时间关系。

随后,模型只围绕这些高价值线索和相关片段生成开放式问答或多项选择题。相比直接把完整剧本文本丢给模型,这种方式减少了无关信息干扰,也把“问题必须依赖证据链”这件事提前写进了生成流程。

消融实验也说明,这不是一个单纯的 prompt 包装。直接生成的 QA 更容易,Qwen2.5-Omni 在 Direct Generation 样本上的准确率为 80.28%;而线索引导生成的样本更难,准确率降至 59.15%。

经过 OmniVideo-100K 微调后,Qwen2.5-Omni 在这类更难样本上的准确率提升到 80.28%。同时,线索引导生成问题覆盖的平均时间跨度达到 144.75 秒,远高于直接生成的 76.24 秒。

这意味着 OmniVideo-100K 不是在制造更多“看图说话”式问答,而是在系统性地制造需要跨时间、跨模态连接证据的问题。

打开网易新闻 查看精彩图片

10 万条训练数据与测试集筛选

基于上述流水线,团队从 5214 个视频中生成了 10 万条音视频问答对。视频来源覆盖 vlog、news、cartoon、sports、documentary、tv、ego 等开放域类别;数据构建过程中会过滤低分辨率视频、硬字幕视频,并根据视觉动态和词密度保留更有音视频信息量的样本。

训练集包含开放式问答和多项选择题,两者比例为 7:3,并覆盖 10 类音视频任务:

  • Alignment:细粒度感知、场景变换检测。

  • Understanding:上下文理解、对比、情感分析、事件排序、摘要总结。

  • Reasoning:因果推理、未来预测、假设性推理。

打开网易新闻 查看精彩图片

〓图2. OmniVideo-100K 与现有音视频指令微调数据集的对比。

与已有数据集相比,OmniVideo-100K 的重点不只是样本数量。

论文强调了三个差异:平均视频长度达到 103 秒;任务包含复杂时间关系;问答被锚定在显式证据链上;同时,结构化剧本本身也可以作为后续视频理解、编辑或生成任务的中间表示。

为了评估模型是否真的具备跨模态协同理解能力,团队还构建了 OmniVideo-Test。

测试集包含 505 道多项选择题,来自 264 个视频,所有题目都经过人工校验。筛选标准包括事实准确、必须依赖音视频联合信息、答案唯一;可以只靠单模态回答、可以猜出、事实有误或选项含糊的题目都会被剔除。

打开网易新闻 查看精彩图片

实验结果:三个开源模型都明显上涨

团队分别对 VITA-1.5、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B-A3B-Instruct 进行了全参数微调,并在 OmniVideo-Test 上评估。

打开网易新闻 查看精彩图片

〓图3. 不同模型在 OmniVideo-Test 上的表现。

结果显示,OmniVideo-100K 对不同规模、不同基座的开源模型都带来了稳定提升。

  • VITA-1.5:整体准确率从 40.99 提升到 61.58,提升 20.59%。

  • Qwen2.5-Omni-7B:整体准确率从 42.77 提升到 60.59,提升 17.82%。

  • Qwen3-Omni-30B:整体准确率从 49.70 提升到 63.56,提升 13.86%。

从任务类型看,现有开源模型在 Understanding 类任务上相对更好,但在细粒度时间对齐和深层跨模态推理上仍然吃力。比如模型可能能听懂一句话,也能识别画面中的动作,却未必能判断这句话和几分钟后的动作之间有什么关系。

论文中的定性案例也体现了这一点:基线模型常常依赖单一模态线索进行猜测,或者只抓住目标时间点附近的信息;经过 OmniVideo-100K 微调后,模型更倾向于引用跨片段、跨模态证据完成回答。

当然,这并不意味着问题已经被解决。Gemini-3.1-Pro 在 OmniVideo-Test 上达到 83.96,人类表现为 100,说明开源模型即便经过该数据微调,距离强闭源模型和人类水平仍有明显空间。

打开网易新闻 查看精彩图片

泛化表现

论文进一步在 Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 等外部音视频基准上评估微调后的模型。

打开网易新闻 查看精彩图片

〓图4. 不同模型在多个外部评测基准上的表现对比。

结果显示,三类基座模型在多个外部基准上也出现一致收益。

其中,VITA-1.5 在 JointAVBench 上提升 12.64%;Qwen2.5-Omni 在 Daily-Omni 上从 62.41 提升到 69.84,进一步拆分后,其 AV Event Alignment 任务从 51.26 提升到 68.49,提升 17.23%。

更重要的是,这种定向微调没有明显损伤通用视频理解能力。论文在 Video-MME 和 Video-MME-v2 上也进行了评估,虽然个别配置有波动,但整体没有出现显著退化。

团队还用 Qwen2.5-Omni 对比了其他音视频数据集微调效果。

AVQA 和 JavisInst-Und 在多数基准上会导致不同程度下降,而 OmniVideo-100K 在 OmniVideo-Test、Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 等评测中取得更稳定的正向收益。

这个对比进一步说明,音视频训练数据并不是越多越好,关键在于样本是否真的训练了跨模态协同能力。

打开网易新闻 查看精彩图片

总结

OmniVideo-100K 提出了一种通过结构化脚本和线索链构建音视频问答数据的新方案。

通过引入全局实体约束与多模态线索挖掘等机制,该方法有效缓解了自动化数据构建中叙事不连贯与问题局部表面化等缺陷。所构建的数据集为提升多模态大模型的音视频理解能力提供了有力的支持。所有训练和测试数据均已开源。

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」