编辑|张倩

最近,你有没有刷到一篇题为《我用 DeepSeek 网页版拿下 KDD Cup 冠军!》的帖子?

这个帖子的作者是 Kaggle 全球排名第一的「无敌叉烧包」同学。最近,他和在国内算法竞赛中累计获得 15 次冠军的队友一起,拿下了 TAAC × KDD Cup 2026 大赛的工业赛道冠军,奖金 15 万美元。

打开网易新闻 查看精彩图片

工业赛道冠军团队「日之光面」。

这个比赛我们之前也介绍过,是腾讯广告算法大赛(TAAC)与 KDD 联动的一场比赛(参见:「龙虾」爆火,token成「硬通货」后,这场AI比赛变得更重要了),奖金池高达 88.5 万美元(约合 600 万元人民币)。学术赛道冠军奖金比工业赛道还高,达到了 30 万美元。这样的赛事级别和奖池规模在国内非常少见。

大赛的报名人数也创了新高 —— 吸引了来自 52 个国家和地区的 13913 名选手,组成 5746 支队伍,覆盖全球 907 所院校,可见赛事竞争有多激烈。

上周,大赛在韩国济州岛(KDD 大会举办地)落下帷幕,学术赛道、工业赛道两大 TOP,以及两项原创突破奖,现场一次性揭晓。

打开网易新闻 查看精彩图片

学术赛道冠军团队 lozyyeah。

正如「无敌叉烧包」同学写的那样,这届比赛有个很有意思的变化:选手们几乎都是「AI Native」的,大模型、生成式工具天然就是他们日常工作流的基础 —— 遇到不会的地方,跟 AI 学;结果提不上去,让 AI 出主意;代码写得慢,用 vibe coding……

「无敌叉烧包」和队友组成的「日之光面」团队更有意思,直接给国产大模型来了个「压力测试」:没有调用任何 API,没有在 GPT 和 Claude 之间切换,全程只用一个 DeepSeek 网页对话框,就跑出了「冠军工作流」,全网直呼「爽文」,帖子也被大量转发。

打开网易新闻 查看精彩图片

「日之光面」团队使用 DeepSeek 网页版打比赛的大致流程。

不过,大家也提到,其实工具便利是一方面,更重要的还是「研究思路」,这也是选手们在比赛中拉开距离的关键。

好在,大赛收官的 workshop 上,获奖选手们把各自的方案完整讲了一遍。听下来最直观的感受是:这道价值 600 万的赛题,确实被「压榨」出了不少真东西,几乎每个获奖方案都有自己的原创突破。这些方案,甚至有可能让广告之外的 LLM 研究也从中受益,因此值得逐个细看。

不过在此之前,我们得先回到起点:这到底是一道什么样的题?

这道题的难点,藏在「统一」两个字里

今年赛题的官方题目叫「面向大规模推荐的序列建模与特征交互的统一」。听着很绕,其实说到底就一件事:用一种统一的建模方法,预测一个用户看到某条广告之后,会不会真的迈出下一步,比如点击、购买、注册,或者下载。行业给这个概率起了个名字叫 CVR,但说白了,它预测的是人的行为,所以要对人有充分的理解。

这个预测怎么进行呢?主要靠两类数据:一类是用户行为序列,像一条不断滚动的时间轴,比如一个用户早上刷朋友圈、中午看新闻、下午在小程序点咖啡、回家路上追剧;另一类是非序列的多域特征,比如用户的「人设」、广告所属的类目,还有一些上下文信号和交叉特征。

当然,出于公平和隐私,这些数据都做了脱敏处理,不放任何原始文本、图片、URL 或可识别个人信息。 所以选手不是在「理解内容」,而是在一堆匿名 ID 和向量里,把「人」和「货」在同一个表示空间里对上号。

打开网易新闻 查看精彩图片

注意,真正的难点其实体现在「统一」这两个字上。

过去,这种预测任务是分开进行的:一个模型处理非序列特征(比如看用户是什么样的人),一个模型处理行为序列(比如看用户最近干了什么),最后再把两边的判断拼起来。这种「各算各的、最后再汇总」的方式,不仅会带来重复的计算和更高的系统复杂度,也很难充分捕捉序列行为与多域特征之间细粒度的交互关系。

而今年赛题要的「统一建模」,就是要找到一种新的模型结构,让不同形态、不同时间维度的信息在同一个模型里真正发生交互。这就像发明一台「超级混动车」,让汽油和电在系统底层就融合成一种统一的能量表征,再高效输出动力。

但真要把这台「超级混动车」造出来并不容易。官方说得很直白:绝不是把所有特征「强行塞进」一个网络就算统一。它要你把非时序的多字段、上下文特征,和带严格时间戳、跨多个行为域的行为流,在同一个架构里深度融合。拍平了会丢掉字段身份和时间关系,全做精细交互又会让算力爆炸。此外,这套统一模块还得在海量、极度稀疏、基数庞大的工业特征面前保持鲁棒。

更苛刻的是鱼与熊掌必须兼得:准确率要上去,还要支持深层堆叠,并在高性能 GPU 上实现大 Batch 的高效训练与推理。而为了逼大家拼模型设计的真本事,比赛全程严禁模型融合(No Ensembling),靠集成刷榜的套路直接作废。说白了,这台车既要爬坡有力,又要省油,还得一口气跑完长途。

这台「车」造出来有什么价值呢?被请到现场发言的 Meta 推荐系统专家 Rui Li 把账算得很清楚,一笔是技术账,一笔是经济账

打开网易新闻 查看精彩图片

技术账的核心问题是:Agent 能替你写代码、订机票、回邮件,但你会让 Agent 替你刷视频、替你刷朋友圈、替你和朋友聊天吗?大概率不会。因为「消费内容、打发时间、维系关系」这些事没法外包,而推荐恰恰长在这些事的入口上。所以哪怕 AI 再往前走,推荐也不会被吃掉。

更关键的是,推荐是一个没有标准答案的问题,信号噪声又极大。所以改进推荐系统更像是一场压力测试,Rui Li 自己都承认「魔鬼都在细节里」。这样一场压力测试对于选手的成长相当有利。

此外,正因为推荐在这种噪声里泡了十几年,才练出一套「从噪声行为数据里把人读出来」的本事。而这套本事,很可能正是今天 LLM 做个性化最缺的那一课 —— 大模型会解题,但还不太会读人,而推荐系统十几年就干了一件事,在嘈杂的行为里读人,这种能力的影响边界可能被低估了。

经济账则更直接。在广告这种场景里,0.1% 的提升就意味着数十亿美元,0.01% 都不是小钱 —— 按 Rui Li 的说法,这比今年发出的奖金多得多。这也是为什么相关人才值钱。

这些价值,都是大赛的吸引力所在。

冠军方案:怎么把效果做到极致?

题读完了,该看解法了。首先来看两个冠军团队的方案,他们解决的是统一建模之后,两个最紧迫的实操问题。这让他们把效果做到了极致。

工业赛道冠军:怎么生成更好的 Query?

工业赛道冠军「日之光面」团队抓住的,是推荐系统里一个很容易被忽略的问题:Query 质量

我们可以把历史行为看作一个信息库,Query 就是模型递进去的检索请求。请求模糊,再长的序列也难转化为有效信号。

官方 Baseline 虽然使用 Cross-Attention 读取用户行为序列,但 Query 主要由简单 MLP 生成,用户、广告和上下文之间缺少充分交互。

于是,团队把优化重点从「塞入更多历史」转向了「生成更好的 Query」,并由此提出 QueryFormer:先让用户、广告和其他非序列特征充分交互,形成质量更高的 Query,再用它从行为序列中寻找与当前广告最相关的信息。

打开网易新闻 查看精彩图片

具体来说,QueryFormer 先按字段边界拆分不同来源的 Dense Embedding,分别生成 Token;随后通过 Self-Attention 完成用户侧、广告侧的内部交互,再以 Cross-Attention 建模用户与广告的匹配关系。这样,模型在读取历史前,已经知道面对的是「怎样的用户」和「哪一条广告」。

在序列检索阶段,QuerySeqCrossAttn 使用广告侧 Query,从四个业务域中动态提取相关行为;SeqQueryCrossAttn 则用 Cross-Attention 替代固定的 MLP 来生成 Query。

团队还通过多列 Embedding Matrix,从同一份输入中学习不同视角的 Query。随着列数增加,模型效果持续提升,但后期收益逐渐减小,因此最终选择了效果与推理效率更均衡的配置。消融实验也显示,多个 Query 优化模块都带来了稳定增益,其中用 Cross-Attention 动态生成 Query 的作用最明显。

打开网易新闻 查看精彩图片

最终结果验证了团队的核心判断:面对漫长而嘈杂的用户历史,提高「检索问题」的质量,比单纯增加历史长度或模型规模更有效

学术赛道冠军:有用信息怎么跨层运输?

「日之光面」解决的是「怎样问对问题」,学术赛道冠军「lozyyeah」关注的则是如何聚焦意图

他们在调研中发现,现有统一推荐模型已经能让用户特征、广告特征和行为序列相互交互,但这些模块主要解决「当前这一层怎样融合」。随着网络不断堆叠,用户意图可能被覆盖,序列信息可能被过度压缩,最终出现表示坍塌和扩展效果不稳定。

为此,团队提出 CRAFT,把研究重点从 Feature Interaction 转向 Feature Transport。它不只考虑特征之间如何交流,还要控制有用信息怎样穿过多层网络。其思路受到 flow matching 的表示运动视角启发,但并非直接套用 flow matching。

打开网易新闻 查看精彩图片

具体来说,模型首先会把输入整理为非序列 Token、序列摘要和 Intent Token。每个 CRAFT Block 会先汇总非序列信息,再生成缩放、偏置和残差门控参数,对 Intent Token 和序列状态进行动态调整;完成这一步「搬运」后,原有的 Cross-Attention、RankMixer 等模块才开始进行特征交互。

其中,Intent Token 不再只是用来检索序列的 Query,而是贯穿多层网络的信息载体。模型既能根据当前样本,把它推向更合适的表示空间,也能在必要时拉回初始状态,从而减少用户意图和序列证据在多层交互中被冲淡。

实验显示,随着 CRAFT Block 增加,模型效果稳步提升,Intent Token 的表示空间也变得更加丰富,说明有用信息确实能够在更深的网络中持续传递。不过,这种收益并不会随着模型变大而无限增长:适度增加宽度效果最好,继续扩展反而收益停滞。

因此,CRAFT 的价值不只是把模型做大,而是提供了一条更可控的扩展路径 —— 让网络在增加容量时,仍能保留并传递真正有用的信息。

不设排名门槛,两项原创突破奖到底在突破什么?

两支冠军队致力于解决信息怎样「取准」「送稳」这两个实操问题,两项原创突破奖则继续向下追问,承载这些信息的系统应该怎样搭、怎样长。

这里需要特别说一下原创突破奖的分量。腾讯官方给这两个奖的定位很特殊,它们不与总排名挂钩,每个奖 4.5 万美元,专门奖励在技术无人区的探索。哪怕最终排名不在前列,只要方案足够亮眼、有原创突破,照样能够拿奖。去年大赛甚至是在颁奖现场临时增设了这个奖项,就为了奖励一支排名不在前三但方案极其出彩的队伍。今年直接预设两个,摆明了态度,他们要把奖励投向可能改变下一代推荐系统技术路线的研究:一个要重写不同特征如何共处的底层架构,另一个要验证这种架构能否真正走向规模化。

打开网易新闻 查看精彩图片

统一框架原创突破奖获奖团队 T-Squared。

打开网易新闻 查看精彩图片

Scaling Law 原创突破奖获得团队 gg。

这种对于技术原创性的看重,让两个突破奖方案有了更自由的探索空间。

统一框架原创突破奖:不同特征之间的通信边界是怎样的?

我们在前面提到,传统推荐模型往往像一座分工明确的工厂:非序列特征由一个模块处理,用户行为序列交给另一个模块,直到最后才汇合。统一框架原创突破奖团队 T-Squared 则希望把这些步骤串成一条流水线,让用户、商品、上下文和多域行为序列在同一个主干中更早、更深入地交互。这也回应了本次大赛的核心命题。

不过,统一并不意味着把所有 Token 放在一起任其交流。多个行为域在语义、长度和时间模式上差异明显,如果采用完全连接的 Attention,无关信息可能互相干扰,强行为域也可能压制弱行为域。为此,团队提出以 TopoMask 为核心的统一框架:表示空间保持统一,信息流动则受到结构约束

打开网易新闻 查看精彩图片

模型首先构建 Global Memory 和 Domain Memory。前者汇总不同来源的全局信息,后者为每个行为域保留独立摘要,避免领域特征被过早混合。DualQ 模块还会围绕当前候选广告,提前建立用户、商品和上下文之间的联系,再生成适配不同领域的 Query。

打开网易新闻 查看精彩图片

进入 MaskRec Block 后,TopoMask Attention 会根据预设的拓扑关系,决定每类 Token 可以读取哪些信息。它类似于把语言模型中的因果 Mask 从「时间顺序」推广到「特征关系」:所有 Token 都在同一个主干中更新,但并非彼此完全可见,从而兼顾统一建模与结构保留。

实验表明,这种受控通信的统一架构能够稳定提升效果,其中稠密特征的结构化组织尤其重要:压缩得太狠会损失信息,拆得过细又容易主导训练、引发过拟合。

因此,TopoMask 的核心价值不只是「把特征放在一起」,而是为不同信息设计合理的连接方式 —— 让该交流的充分交流,不该混合的保持边界

Scaling Law 原创突破奖:模型变大时,新容量里该装什么?

Scaling Law 原创突破奖获得者 gg 团队关注的,是推荐模型扩容时一个更基础的问题:新增参数究竟应该用在哪里

官方 Baseline 已经能够统一处理静态特征和行为序列,但多组 Dense 和用户画像特征被过早压缩,多值特征中的细节也容易在池化中丢失。此时继续加宽模型,可能只是让它反复处理同一批有限信息。

为此,团队提出 CosFormer,核心思路是让「信息」和「模型宽度」协同扩展。传统方法通常保持输入 Token 不变,只增加处理这些 Token 的参数;CosFormer 则要求每次增加模型容量时,都同步加入一组携带新信息的 Token。换句话说,模型不仅要变得更强,也要看到更多有价值的东西。

打开网易新闻 查看精彩图片

这些新增 Token 被组织为四类语义信息:静态特征、显式交叉特征、序列相关特征和全局特征。例如,不同来源的 Dense 特征不再被过早压缩,用户与候选广告的交互也被提前显式建模,时间和历史窗口信息则形成独立通道。所有 Token 最终进入同一条信息流,由统一模型完成预测。

信息变多之后,CosFormer 还要解决「怎样把它们用好」。MaskNet 引导的双流结构会根据当前样本选择和重加权不同通道;Token-type Private FFN 则让同类 Token 共享网络、不同语义类型分别处理。这样既能提高模型的专业化程度,也避免为每个 Token 单独建模带来的过拟合。

实验中,信息与宽度协同扩展带来了持续而稳定的收益,单纯增加参数或加入不携带新信息的空 Token 则很快遇到瓶颈。随着新增信息逐渐重复,模型的边际收益也会下降,形成一个经验上的「信息前沿」。

打开网易新闻 查看精彩图片

这说明推荐模型的 Scaling 不能只看参数量:新增容量只有承载新的有效信号,并配套相应的信息选择机制,才可能真正转化为效果提升

把四套方案放在一起看,层次其实很清晰:QueryFormer 解决了输入端的问题(怎么问对),CRAFT 解决了传输层的问题(怎么保真),TopoMask 重新定义了架构层的连接规则,CosFormer 则摸到了扩展层的规律边界。从「怎么问」到「怎么传」,再到「怎么连」、「怎么扩」,它们拼出了一条从局部到系统、从当下到未来的完整技术主线 —— 推荐系统的下一步,不会只靠更大的模型,而要靠更高效的信息组织。

600 万奖池之外,这场比赛真正留下了什么?

跳出赛题本身,从外部视角看,这场比赛真正沉淀下来的,是两样东西:一样给了行业,一样给了人。

给行业的,首先是方向。Rui Li 在演讲里把话说得很明白:只要持续投入算力,推荐模型就能持续换回收益。也就是说,Scaling Law 这套在 LLM 身上被验证过的逻辑,这次被系统地搬进推荐,相当于把这条路又照亮了一截。

打开网易新闻 查看精彩图片

其次是数据。推荐研究这么多年跑得不快,一个绕不开的原因是工业数据很难拿到。Rui Li 提到,他 20 年前读博时,连一份能用来做研究的推荐数据集都找不到;LLM 跑得快,很大程度是因为它有公开数据、公开 benchmark,而推荐领域不然。腾讯这次把海量真实业务日志清洗、脱敏到能拿出来公开比赛的程度,本身就是在补学术界和工业界之间最难补的那道 gap。数据一旦开放,后面整个领域的研究节奏都会跟着快起来。

给人的,则是舞台和去处。和 KDD 联动之后,选手站上的不再是一个公司办的赛场,而是国际舞台。大家和来自 52 个国家和地区的一万多名选手同台竞技、互通有无,简历上从此多了一项全球都认的加分项。

更实在的是后半程:比赛结束不是句号,腾讯并没有把它当成一次性的选拔,而是放进了一套长期的人才布局里:赛事负责让全球技术人才同场交流、展示能力,青云计划负责在赛后持续关注和支持,覆盖发现、吸纳、培养几个环节。接下来,腾讯还会面向有实力、有实操能力、能把想法快速落地的人,提供持续的技术交流、产业研究和项目实践机会。对选手来说,这意味着进入真实业务场景的机会,他们可以接着把事做下去。

等到明年的大赛开场,今天被验证的技术路线,或许已经成为下一轮竞争的起点。到那时,新一批 AI Native 选手又会把推荐系统往前推多远?值得期待!