打开网易新闻 查看精彩图片

AI会“看”广告了,但离理解消费者意图和 Agentic Commerce 还有距离。

作者丨李秋悦

编辑丨吴 彤

婚礼现场,一座由酒杯堆起来的小山突然轰然倒下。

如果把这几秒视频交给多模态模型,它并不难描述发生了什么:婚礼、酒杯、倒塌,一场突如其来的意外。甚至可能进一步猜测,是震动或者某种外力导致了这一幕。

但一个真正坐在屏幕前的人,脑子里冒出来的往往是另外一些东西。

“好好的婚礼怎么突然出事了?”“这么多杯子摔碎,要赔多少钱?”“满地玻璃得多难收拾?”意外、美好场景被破坏后的不适,以及一点好奇,共同构成了人愿意继续往下看的理由。

这是ECCV MARS2 Workshop 2026挑战赛双冠团队The Boys在赛后复盘时举出的一个例子。

打开网易新闻 查看精彩图片

The Boys团队在ECCV 分享技术方案。团队成员包括来自字节跳动的刘博元、孙腾豪、谢子凡、邢佳豪

9月9日,MARS2 Workshop在瑞典马尔默举行的欧洲计算机视觉大会ECCV 2026期间举办。MARS2全称为“Multimodal Reasoning and Slow Thinking in the Large Model Era”,由钛动科技牵头发起,讨论的是一个当下多模态大模型正在面对的问题:当模型已经越来越擅长识别图像和视频里的物体、文字与场景之后,能不能再往前一步,对复杂的时间关系、因果关系和抽象意图进行推理。

官方将其目标概括为推动多模态模型从传统的感知任务走向更复杂的“System 2”式推理

比赛本身从6月1日持续到8月1日,通过EvalAI进行,参赛团队围绕同一套广告视频数据提交模型结果;到了9月9日的Workshop现场,获奖团队进行技术方案展示并完成颁奖。官方披露的数据集包含3000余条视频、9000余组问答。

不过MARS2并不是今年第一次举办。第一届Workshop于2025年在ICCV举行,当时三条挑战赛中,只有VR-Ads涉及广告视频,另外两条分别考察现实场景视觉定位和空间推理。到了2026年,题目明显发生了变化,三条赛道全部围绕广告和营销展开。

今年的三道题分别为:

MAC:AI能不能把一条广告整体看懂;

VTG:要求它进一步指出,支撑某个判断的关键证据具体出现在视频第几秒;

MDC:追问广告为什么这么拍,用了什么方式抓住注意力,品牌如何被植入,又试图触发消费者什么心理。

打开网易新闻 查看精彩图片

竞赛团队背景分布图

比赛吸引了全球64支团队参赛,累计提交超过1060份方案。参赛者既有来自中国科学技术大学、南开大学、中山大学等高校的研究者,也有字节跳动、京东、小红书等企业的技术团队。

最终,字节跳动背景的The Boys团队拿下MAC、MDC双冠军及VTG亚军。

不过,比名次更值得追问的是:

1.广告为何成了测试多模态推理的新场景?

2.高阶推理真正缺更大的模型,还是更完整的证据、上下文和验证机制?

3.AI距离真正理解消费者、进入Agentic Commerce还有多远?

以下是AI科技评论分别与“出题人”钛动科技技术VP Tracy Chen和“解题冠军”The Boys团队的对话:

01

谁在出题:一家产业公司进入学术顶会

AI科技评论:MARS2在ICCV 2025已经举办过第一届,当时钛动不在主办方名单中。你们是怎么进入MARS2的?

Tracy Chen:最开始其实不是奔着办比赛去的。

钛极VL(Tec-Chi-VL,钛动科技自研专业大模型钛极旗下的内容理解模型)早期在做广告营销内容理解,我们需要找一个比较合适的Benchmark做优化和衡量,后来筛选到了ICCV 2025的AdsQA。AdsQA本身也是第一届MARS2 Challenge的一条赛道。

通过AdsQA团队的引荐,我们联系到了MARS2的组织者。交流之后发现双方关注的问题很接近,他们希望研究更真实、更复杂的多模态慢思考和多跳推理问题,而我们恰好长期服务出海品牌,有很多来自真实产业一线的问题和场景。

所以合作不是从“要不要办一场比赛”开始的,而是先从具体的问题和数据讨论开始,最后慢慢形成共同设计Challenge的想法。这也是钛动一直坚持的 Useful AI 理念,AI 的价值不在炫技,而在真正落到业务里解决具体问题。Challenge 只是把这一理念落地的方式之一。

AI科技评论:钛动这次作为主办方,具体做了什么?

Tracy Chen:我们深度参与了会议申请组织和赛题设计。

第一步是梳理产业问题。真实业务里的很多问题很复杂,甚至比较模糊,我们要把它拆成一个可以被定义、被标注、被评测的研究任务。

然后是数据和标注方案,包括数据脱敏、任务边界、标注标准;再往后是评测设计、参赛队伍沟通,以及比赛过程中的技术支持。

我们不希望只是拿一批广告视频出来,让大家做普通的视频问答。更重要的是把广告营销里的真实难点放进去,比如时间关系、跨模态证据、品牌植入和创意策略。

AI科技评论:2025年MARS2只有一个广告赛道,为什么今年设置了三条赛道都围绕广告展开?

Tracy Chen:不是某一方单独决定的,而是在双方讨论过程中逐渐形成。

2025年的VR-Ads已经证明,广告是一个很有潜力的多模态推理场景。今年我们想把问题再拆细一点,分别看模型的内容理解、证据定位和策略推理能力。

广告的特殊之处在于,它既有画面、文字、声音、时间顺序这些显性信息,又有注意力引导、情绪变化、品牌记忆和用户心理这些隐性信息。

模型只知道“看到了什么”其实不够,我们还想知道,它能不能找到支撑判断的证据,能不能解释为什么这么判断。

AI科技评论:为什么偏偏是广告?机器人、自动驾驶、医疗也需要复杂的多模态推理。

Tracy Chen:广告同时包含事实信息和意图信息。

画面里有什么、字幕写了什么、人物做了什么,这是事实。但为什么这个镜头在这里出现,为什么这里用了某段音乐,品牌为什么最后几秒才出现,这些已经涉及创意意图和消费者心理。

而且广告通常是一条完整的时间序列,单看一个镜头很难理解它的作用。你要把前后镜头、配音、音乐、字幕、品牌露出串起来,才能理解完整的创意逻辑。

AI科技评论:The Boys在比赛里觉得广告最难的是什么?

The Boys:我觉得最难的就是心理层面的引导。

比如刚才那个婚礼酒杯的case。AI可能看到的就是酒杯倒了,但一个人看到之后,会自然联想到:“这么美好的婚礼怎么出了这种事”“杯子是不是很贵”“地上是不是特别难收拾”。这些生活里的下意识联想会驱动人继续看。还有比如解压视频,人会觉得很舒服、很解压,但你让AI解释为什么人喜欢看、为什么解压,其实很难。

广告的创作者会利用用户真实生活产生的情绪和消费心理,但AI没有这种真实生活的先验。

AI科技评论:所以MAC和MDC真正的区别是什么?

The Boys:MAC相对更偏客观问题,MDC偏主观。

MAC可能是视频在讲什么、发生了什么;但到了MDC,你开始问品牌怎么植入、为什么能吸引注意力、消费者可能有什么心理,这就不只是识别事实了。

AI科技评论:但这种“消费者心理”本来就没有唯一答案,怎么评分?

Tracy Chen:这类问题不能假设只有一个标准答案。

我们的做法是先标可以观察到的事实和证据,再标基于这些证据形成的策略解释。不同标注者或者标注模型之间出现的共识和分歧也会记录下来。

分歧最大的往往不是事实本身,而是创意意图和消费者效果。比如某个镜头到底是在强化品牌记忆,还是主要做情绪铺垫。

对于这类问题,我们会通过多标注者、多个异源模型,加上标注指南和专家仲裁,尽量把事实判断和解释判断区分开。

打开网易新闻 查看精彩图片

钛动科技技术VP Tracy Chen 在ECCV介绍赛事

02

怎么解题:

先让模型看到正确的证据

AI科技评论:看完整场比赛之后,你认为今天多模态推理最大的瓶颈是什么?是基础模型还不够聪明,还是正确的信息根本没有进入模型?

Tracy Chen:我认为最大的瓶颈,是信息获取、信息整合和判断验证还没有真正形成闭环。

模型可能已经具备不错的语言推理能力,但如果关键文字没有被识别,声音没有被解析,时间关系没有被保留,那么后面的推理其实建立在不完整的信息上。

所以这不只是“模型够不够大”的问题,也不只是“基础模型够不够聪明”的问题。系统首先要知道应该看什么、去哪里找证据、如何处理不同模态之间的冲突,以及如何检查自己的结论。换句话说,未来的多模态推理,不只是让模型想得更久,还要让它看得更准确、找得更主动、验证得更充分。

AI科技评论:The Boys三条赛道具体是怎么做的?

The Boys:其实我们一开始是想共用一些数据预处理手段的,比如说分镜、翻译这些。但是VTG比较特殊,它的总参数量是要比另外两个赛道要小一些的,而且我们实验也发现,就是分镜和翻译对VTG任务的提升并不大。

所以我们MAC和MDC采用了一个相同的数据预处理方案,然后VTG单独搭建了一套。

共同部分的话,就是分镜、ASR翻译,然后逐分镜理解,并汇总所有分镜理解结果后的整体视频理解结果。

AI科技评论:其他获奖队伍出现了一个很有意思的现象,增加音频、OCR、时间轴等证据,比单纯把模型做大更有效。你们自己的实验是否也观察到类似现象?目前多模态推理最大的瓶颈到底是“模型不够聪明”,还是“模型根本没看到正确的信息”?

The Boys:音频这个模态比较特殊。传统VLM,比如千问,在视频理解中主要还是依赖抽帧和文本,并没有单独处理音频的模态,所以把音频信息补进来,通常会带来比较明显的提升。

OCR我们没有单独做。一方面,文字信息本身就在视频画面里;另一方面,视频中经常会出现大量环境文字,如果全部提取出来,反而容易给模型造成干扰。

时间轴这块,我们采用的是切分镜的方法。先把视频拆成多个分镜,让模型分别理解每一个片段,再把这些结果整合起来。这样每一次处理的都是一个更小、更明确的任务,相比直接让模型理解整段视频,更不容易漏掉细节。

现在多模态推理的一个重要瓶颈,未必只是模型本身不够聪明,也在于不同模态的信息特性差异很大。图片天然信息比较分散,文本的信息密度更高,而模型目前也更擅长从文本中寻找关键信息。因此,一个很重要的问题是怎么管理好有限的上下文,把分散在视频里的信息整理得更清楚,尽可能降低模型找到正确信息的难度。某种程度上,这也可以弥补模型能力本身的不足。

AI科技评论:MDC最容易出现一种情况,模型给出的解释听起来非常合理,但未必真的来自视频。你们怎么判断自己的模型是在“理解广告”,而不是利用语言模型已有的营销常识补故事?

The Boys:这个就是很常见的大模型幻觉。

所以我们对视频数据做了很充足的预处理,比如分镜、内容理解、翻译,并且给出了结构化的结果。

我们要求模型在回答问题的时候,针对这些结构化结果进行举证,然后用另一个模型判定模型的举证是否正确。

AI科技评论:这次赛事方总结了Proposer-Critic、coarse-to-fine、动态Token等方法,但目前外界很难知道哪些属于The Boys。你们实际用了哪些?还有哪些关键方法没有被公开报道准确概括?

The Boys:Proposer-Critic和coarse-to-fine我们都用了。后来看到技术报告,发现不少参赛团队也不约而同采用了类似思路。

对我们来说,一个比较simple but effective的方法,就是先把视频分镜,再逐段理解,最后整合结果。这样可以降低模型幻觉,也能减少小参数模型在理解长视频时漏掉细节的情况。

AI科技评论:如果模型已经拿到了证据,也有了第二轮验证,那是不是意味着下一阶段System 2的重点,不一定只是让模型“想得更久”,而是让它知道什么时候该重新看、去哪里找证据、什么时候该怀疑自己的答案?

The Boys:这个问题和模型参数量、Agent能力都有关系。对小参数模型来说,单纯增加thinking budget未必有效,模型可能会反复推理、原地打转,甚至因为上下文变长而出现性能下降。

相比之下,让模型重新看、重新找证据、怀疑自己的答案,更接近Agent的工具调用和上下文管理能力。如果这部分做得足够好,未必需要一味让模型“想得更久”。

AI科技评论:Team Saucy的公开实验里,增加Audio-Evidence Timeline的收益比4B换8B更大。是不是说明模型做大没那么重要了?

Tracy Chen:不能这么解释。更准确地说,在这个任务和实验范围里,输入信息的质量和组织方式,可能比有限范围的参数增加更重要。

如果一个4B模型拿到了完整、准确、时间关系清晰的证据,它可能比一个8B模型直接面对缺失、混乱的输入表现更好。但这不意味着Scaling没用了。更大模型仍然会影响复杂推理、泛化和工具协调。

未来更值得关注的可能是“联合Scaling”,模型规模、数据质量、上下文长度、工具调用次数、验证计算,到底怎么一起分配。

AI科技评论:如果未来最强的AI系统越来越像“基础模型 + OCR + ASR + 检索 + 工具 + Critic + 规则”的组合,那么我们今天只看某一个基础模型排行榜来判断AI能力的方式,是不是已经开始过时?

Tracy Chen:对于具体应用来说,单一基础模型排行榜并不足以代表特定任务或特定系统的能力。

基础模型排行榜可以反映模型的通用能力,但真实业务看的是一整套系统:能不能找到证据、能不能稳定调用工具、能不能处理异常、成本和延迟是否可接受。

有些模型规模不大,但通过更好的OCR、ASR、时间建模和验证机制,在特定任务上也可能表现得很好。

所以未来要看的,不只是“哪个模型分数最高”,而是“哪个系统在真实任务中完成得最好”。

打开网易新闻 查看精彩图片

钛动科技技术VP Tracy Chen (右2)和钛动科技团队在ECCV

03

题外之谈:

离真正的Agentic Commerce还有距离

AI科技评论:Agentic Commerce和过去的推荐系统、营销自动化到底有什么本质区别?为什么它的出现,会让广告理解这件事变得更重要?

Tracy Chen:过去的营销自动化,很多时候是按照预先设定好的规则执行,比如人群定向、素材组合、投放和报表分析。

但Agentic Commerce的出现,让系统开始参与更完整的决策链。它不仅要理解商品和用户,还要理解内容、场景、意图、约束,以及行动之后可能产生的结果。

这就带来了一些过去没有那么突出的问题,第一,Agent 是否真的理解了用户需求,而不是只做关键词匹配;第二,它给出的推荐或生成的内容是否有证据;第三,它是否符合品牌和平台的约束;第四,当信息不完整时,它能不能主动澄清,而不是自信地做出错误判断。

从过去固定的流水线式模板,生硬的算法判断与路由,到今天agent放置于更广阔更开放的通用场景,模型除了是坚定的执行者,更是决策者,需要承担更多的责任与风险。如果未来Agent进一步参与预算分配、下单和售后,那么我们还需要解决可追溯、可解释、可审计和风险控制的问题。

广告理解已经不再只是内容分析的基本能力,它正在升级为智能体商业的核心,需要有更长线、更细致的思考,以及更精准的判断力。

AI科技评论:你怎么定义Agentic Commerce?一个AI必须自主完成到哪一步,你才愿意称它为Agentic Commerce,而不是传统的推荐系统、营销自动化或者购物助手?

Tracy Chen:关键不在于它的称呼,而在于它能不能围绕一个目标,自己完成一段连续的任务。

比如,它不仅能理解用户需求、搜索和比较商品,还能调用相关工具,根据中间结果调整判断,最后完成推荐、营销,甚至交易等后续动作。

传统推荐系统主要是给出一个结果,营销自动化通常按照预设规则执行,购物助手更多是回答问题。Agentic Commerce则更接近一个能够理解目标、制定步骤并执行任务的系统。

当然,自主并不意味着没有边界。真正成熟的Agent,一定是在约束条件下把事情做好,而不是“什么都敢做”。

AI科技评论:如果把Agentic Commerce拆成“理解需求—搜索—比较—推荐—营销—下单—支付—售后”,MARS2目前测试的是哪一层?从这里走到真正替消费者花钱、替品牌花预算,中间最大的鸿沟是什么?

Tracy Chen:目前Agent在理解需求、搜索信息、整理资料和初步比较方面,已经能够承担不少工作,甚至在推荐和内容生成上,也有比较好的辅助价值。但越接近下单、支付和售后,要求就越高。因为这时不仅要回答得对,还要涉及权限、资金、安全、责任归属,以及异常情况怎么处理。

MARS2目前测试的不是完整交易闭环,而是其中很重要的一层认知基础,即系统能不能先把问题看懂、证据找对,再做出相对可靠的判断。

从“理解—证据—推理”走向真实交易,还需要解决好几道难关,比如能否精准管理用户授权和预算边界,对于自己的不确定性做出清楚表达,出错之后能否及时发现、回滚和实现追责。另外,还需要补全投放合规、效果归因和实验管理等能力。

The Boys:我觉得一个最大的鸿沟还是心理层面的。

比如能不能感知消费者实际的痛点,什么样的口播文案和营销策略更可能实现转化,以及用户有没有耐心继续停留在当前广告。

这些其实都比单纯看懂内容难很多。

AI科技评论:如果把这次比赛最好的方案直接放进真实广告业务,最先暴露的问题会是什么?

Tracy Chen:最大的落差还是真实环境更复杂,责任也更大。

比赛里的任务和数据相对明确,但真实客户涉及不同语言、行业、品牌和投放目标。对于参赛团队而言,比赛答错可能只是少拿一些分,但对于所有产业方来说,真实系统答错,可能会浪费预算,甚至带来品牌和合规风险。

所以比赛方案不能直接照搬上线,还要经过真实业务场景验证、成本和稳定性测试,再通过灰度和人工审核逐步接入。比赛更像是帮助我们发现技术方向,距离真正的生产系统还有一段工程和治理过程。

The Boys:我能想到的第一个最大问题就是语种上的不适配。

中文场景、中国人的生活习惯、中国人的常用软硬件,相同的一个CTA,不同城市的广告场景可能都会有差异,更别说不同语种了。数据的水土不服,会天然带来转化行为上的差异。

而且广告素材的实际投放表现,很大程度上是后验的。从内容去做推断,只能保证它的下限,比如是否确实表达清楚了某个转化目的,但决定不了一个素材表现的上限。

AI科技评论:如果让你们设计MARS2 2027的一道新题,你们最想测试什么目前Benchmark还没有覆盖、但真正决定AI能不能进入商业决策的问题?

The Boys:我觉得MDC赛道就是一个很好的实验田。现在模型针对客观事实和人的主观情绪,判断能力上的差异还是挺大的,但也确实能看到模型优化这方面能力的潜力。模型可以通过数据学到,人可能会对广告里的哪些点感兴趣。

我觉得这个问题既可以是时间维度的,也可以是空间维度的。

如果让我设计的话,我会想一道时间维度的题:比如一条广告在第几秒钟,被用户划走、关闭或者发生转化的概率更高?

空间维度上,也可以把两张广告图片摆在一起,让模型判断用户更可能点击哪一张。

如果模型能够拟合出人对空间兴趣点和时序兴趣点的偏好,同时给出合理理由,我觉得才更有可能用这种模型反过来调整素材生产策略和投放策略。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。