几乎每周,arXiv 上都会涌现几十篇关于"大模型+推荐系统"的新论文。
但一个尴尬的现实是:绝大多数研究停留在小数据集、小模型、离线评测的舒适区里。真实工业场景的数据分布、千亿级物料规模、用户行为的动态噪声和意图漂移,是任何 academic benchmark 都无法模拟的。
学界与工业界之间,横亘着一道数据、规模与评测标准的鸿沟。
快手每天为数亿用户完成超过千亿次的推荐决策。在这个规模之下,每一次算法的迭代,都不只是指标的跳动,而是在精准与多元之间寻找更好的平衡。也正是在这个量级上,快手选择了一个反常规的解法:不砌墙,而是拆墙。
在技术沙龙第四期上,快手正式发起「探索者 LLM-Rec 挑战赛 2026」,向全球学生开放真实业务脱敏数据、工业级基座模型和严格的评测体系。这是业界唯一一个以"大模型 × 推荐能力深度融合"为赛题的全球开放赛事。
为什么快手敢这么做?
OneReason 先证明了:这条路走得通
要理解快手为什么敢把核心场景开放给全球学生,得先理解 OneReason 是什么。
简单来说,它是快手推出的生成式推荐推理模型。目标只有一个:让推荐系统从"预测下一个 token"进化到"理解为什么推荐"——从 Scaling 走向 Reasoning。
包括早期 OneRec 在内的传统推荐系统,底层逻辑是 Scaling Law:堆数据、堆参数、堆算力,预测用户可能点击的下一个 item。OneRec V1/V2 已经验证了这条路在工业级场景跑得通,并在快手多个业务中实现规模化落地,释放了 next-token prediction 框架下的 Scaling 收益。
但瓶颈也很明显。模型知道"用户可能会点这个",却不知道"用户为什么点这个"。推荐系统本质上是一个巨大的黑盒,输入行为序列,输出排序结果,中间发生了什么,没人说得清。在复杂场景下,这种"无差别预测"的精度天花板已经越来越近。
快手推荐模型部生成与排序模型负责人唐睿明在技术沙龙上分享了具体路径。
第一步,搭建面向推荐任务的 CoT(Chain-of-Thought)数据体系。传统推荐模型直接输出排序结果,OneReason 则要求模型在推荐过程中显式地"思考",先拆解用户意图、分析物料关联、推理行为动机,再生成最终推荐。这种"先想后推"的机制,让推荐决策从黑盒变成了可解释、可优化的推理过程。
第二步,在 RL 阶段引入 Reasoning 数据飞轮。光有 CoT 还不够,推荐场景的真实反馈是持续流动的。团队通过多轮迭代,让模型在真实业务反馈中持续优化 CoT 质量:推理得好,推荐准,用户反馈正向,模型就强化这条推理路径;推理得差,推荐偏,用户反馈负向,模型就修正逻辑。这是一个自我进化的闭环。
OneReason 不是实验室里的概念验证。它建立在 OneRec V1/V2 已经验证的 Scaling-Law 之上,并进一步证明了 Reasoning 在推荐系统里的有效性,且已部分赋能业务。
这意味着,"LLM×推荐"不再是 PPT 上的愿景,而是已经有了一个可以站在上面继续往前推的脚手架。只有当这个脚手架足够结实,快手才谈得上把下一阶段的探索权交给社区。
懂物料:根据 Itemic Pattern 反解物料内容,对应 OneReason 对多模态语义主成分 ID 的表征能力;
懂用户:从全域行为链中区分噪声与信号,识别需求的触发、深化与落地,对应 CoT 数据体系对用户意图的推理能力;
懂推荐:根据历史行为预测真实需求,对应生成式推荐的 core capability;
懂世界:保留大模型通用知识和社会常识,对应 OneReason 配比大量通识 Reasoning 数据的设计理念。
只有先定义了标准,才敢把这个标准交给全球去检验。
快手把什么交给了社区?
这不是一场在标准数据集上刷榜的学术竞赛,而是一次工业级能力的平权化。快手开放的不仅是数据,而是从基座到评测的完整四层配置。
第一层:技术基座
选手不需要从零造轮子。组委会直接提供 OneReason-0.8B-pretrain:基于 Qwen3-0.6B 热启,扩充推荐域 Itemic token 词表后参数量 0.8B,经过 578B Token 多阶段预训练,并配比大量通识 Reasoning 数据。从第一天起,参赛者就站在和工业级 baseline 几乎同一起点上做创新。
第二层:真实场景
实验室的干净数据已经不够用了。赛题提供的 SFT 数据与 50 万条用户行为数据,量级和分布贴近真实业务场景,覆盖四个维度:
物料语义理解:增强模型从 itemic token 中还原物料语义的能力,强化模型感知;
用户需求演化:从用户全域行为链中区分噪声与信号,识别需求的触发、深化与落地轨迹;
推荐行为建模:根据用户历史行为序列,深度理解并预测用户的真实需求;
通用知识与常识推理:保持模型在开放问答中的基础知识、常识理解与推理能力。
第三层:公平机制
为了保证公平和防过拟合,赛事采用多阶段递进机制。
对学界的"刷分套路"几乎是一刀切的:你必须真的做出可复现的东西。
第四层:顶级背书
赛事与信息检索与推荐系统全球顶会 ACM SIGIR 2026 联办。你的算法不仅要过学术界的关,还要经得起工业界最严苛的业务审视。赛事技术平台由快手万擎(企业级模型服务与 AI 算力云平台)提供支持,为参赛选手提供数据管理、模型精调与评测等全链路能力保障。
快手在寻找什么样的人?
闭源评测和复现审核的设计,意味着这场比赛不欢迎"只调参不思考"的榜单刷手。
面向全球范围内各类院校的全日制在校学生开放,参赛者不限国籍、院校和专业。1–3 人组队即可参赛,支持单人参赛。快手在寻找"没有路径依赖"的破局者。一个高中生或一个博士后的奇思妙想,可能比大厂的渐进式优化更有颠覆性。
奖励的设计也透露了真实意图。总奖金池 100 万元,冠军 40 万元,这笔钱足够有吸引力,但快手真正想给出的筹码是人才通道:Top 3 直通 K-Star 级别 offer,这是快手内部最顶级的校招通道;决赛前20名,免笔试,直达快手算法终面。在全球 AI 人才竞争白热化的当下,这是一场精准的人才捕捞,而非榜单营销。
更深层的信号是共建者逻辑。快手把基座、数据、评测标准全部开放出来,是希望找到真正能推动 LLM × 推荐方向的人,让"无人区"变成"有人区"。
从 2023 年的 Scaling、2024 年的 Reasoning,到 2025 年之后的 Agentic。通用大模型已经走过的这条路,推荐系统才刚刚走到第二步。快手选择把接下来这段路开放给社区共同探索,本身就是对行业下一阶段最直接的押注。
真实战场,欢迎入场
当生成式推荐走向体系化,实验室刷榜的尽头,是真实世界的检验。
报名窗口:6 月 13 日 – 6 月 29 日
赛事官网:ks-llmrec.streamlake.com
决赛:9 月底,北京线下
做有挑战的事,一同见证推荐系统的未来。快手已经搭好了擂台,现在,轮到年轻人上场了。
加入ZF讨论群,请先添加小助手微信
我们相信认知能够跨越阶层,
致力于为年轻人提供高质量的科技和财经内容。
稿件经采用可获邀进入Z Finance内部社群,优秀者将成为签约作者,00后更有机会成为Z Finance的早期共创成员。
我们正在招募新一期的实习生
热门跟贴