8月28日,腾讯混元发布并开源Hy4 preview。从今年2月重建预训练与强化学习基建算起,混元把大版本的迭代周期压缩到两个月左右。这已经接近Anthropic、OpenAI、智谱等头部模型厂商的更新频率。差别在于,腾讯是在重建地基的同时跑出了这个速度。

版本间隔缩短,能力跃升幅度持续变大

打开网易新闻 查看精彩图片

Hy4 preview总参数达到770B,是Hy3的2.6倍;激活参数从21B提升到49B,上下文从256K扩展到1M。7月初,Hy3在软件工程实战基准DeepSWE上拿到28.0分,同期Claude Opus 4.8是58.0。不到两个月,Hy4 preview在同一项测试上拿到64.3,超过DeepSeek V4 Pro的62.7。

同一天公布的Terminal-Bench 2.1上,Hy4 preview拿到85.4分,与Claude Opus 5持平。如果把Hy3 preview以来的三个版本放在一起看,混元在多项主流benchmark上都画出了一条显著上升的曲线。总的来说,混元整体仍在追赶阶段。但在更接近真实生产力的任务上,混元实打实追赶上来了,尤其是长上下文任务、代码库重构、专业科学推理等方面。

每一次发布,都是实战

Hy4 preview发布当天,WorkBuddy和CodeBuddy同步开启两周免费体验。混元团队在说明中提到:“如同Hy3 preview,我们希望通过Hy4 preview的尽快发布获得广泛的真实反馈,从而显著提升Hy4正式版。”同一套流程,混元已经走过一遍。

4月23日,Hy3 preview开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima和QQ等多个业务产品。三个月后,Hy3正式版发布。团队表示,Hy3 preview已在50多个业务中获得广泛反馈,修复了大量体验问题;正式版在此基础上,进一步提升后训练数据的质量与多样性,并扩大了强化学习的算力规模。

变化体现在核心指标上。对比preview版,Hy3正式版的幻觉率从12.5%降到5.4%,常识错误率从25.4%降到12.7%,多轮对话问题率从17.4%降到7.9%。这不是单靠增加参数就能解决的。模型在真实任务里会犯一些非常具体的错误。比如忘记用户几轮前提出的限制,工具调用失败后盲目重试,任务已经完成却不知道什么时候该停等等。

只有把模型放进产品,让它持续面对真实用户,再把失败过程拆开,找到问题发生在哪一步,补充正确的任务轨迹和判断标准,错误才可能被一条条纠正。Preview不是一个版本标签,而是将真实使用纳入模型研发的行业机制。

早在2022年,OpenAI就把ChatGPT作为research preview推向公众,希望借此收集用户反馈,了解模型在真实世界中的优势与局限。后来的o1-preview、GPT-4.5,也延续了相似的发布方式。OpenAI将其称为“迭代式部署”:不是等系统在实验室里变得完美再推出,而是让一个仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。如今,分阶段开放、早期测试和preview-first,已经成为前沿模型常见的研发机制。每一次preview都不只是一次产品公测,也是一次大规模实战。正如混元团队所说,Hy3 preview是混元从读万卷书到行万里路的开端。

实战反馈,如何变成模型能力

发布大模型只是第一步。它能不能真的进步,取决于收回来的是什么,以及这些东西能不能变成有效的训练材料。Hy4 preview的官方说明里,有一句容易被略过的话:模型能力的提升,来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。

Hy3时期,重点是与CodeBuddy、WorkBuddy等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。到了Hy4阶段,在产品反馈之外,来自各个专业领域的专家共建被放到了更靠前的位置。这是两个不同层次的反馈。用户告诉模型“哪里不好用”,专家告诉模型“什么才算真正做好”。

一个金融分析任务,普通用户可能只能判断最后的报告能不能用;专业人士则可以进一步判断统计口径是否一致、证据链是否完整、风险提示是否充分。一个软件工程任务,测试通过不等于代码可以合入,工程师还会看架构、可维护性、性能和潜在回归。让产品反馈和专家判断组织起来,参与模型训练的方法,腾讯内部叫Co-Design。

什么信息该给模型,什么时候给,以什么结构给;模型可以调用哪些工具,怎样判断任务完成,失败后又该如何恢复——这些都不是模型团队关在实验室里能独立想明白的。Co-Design做的,是让多方一起定义问题,而不是等模型训练完成,再由产品接上一个API。混元内部还建立了50多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。

姚顺雨的判断是,真正有价值的进步来自产品侧回流的真实Prompt分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清楚的需求。用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再把三者变成后训练和评测体系。这才是反馈真正转化成模型能力,实现Co-Design loop的全过程。

腾讯的Agent产品矩阵,混元的训练场

WorkBuddy的界面上,摆着多个厂商的十余款模型。混元、DeepSeek、GLM、Kimi、MiniMax,用户点一下就能切换,没有唯一选项。这给混元设置了一个比内部评测更直接的考场。每一次切换都是一次投票。每一次重复使用也是一次投票。结果是Hy3留住了用户。

今年7月8日,Hy3正式版在WorkBuddy上线后,调用量一度把算力打满。当天下午排队率超过50%,团队紧急扩容。原定两周的免费体验,也因为需求过大延长到了8月底。自上线WorkBuddy以来,主动选择Hy3 preview的用户数量增长了6倍。接入Hy3正式版后,WorkBuddy内部测评的任务成功率从72%提升到90%,平均耗时缩短34%。

这些数字至少证明了一件事:模型在内部评测中获得的提升,有一部分转化成了用户能够直接感知的体验。用户选择只是结果。对模型研发更重要的是,用户为什么选择它,又为什么放弃它。在多模型共存的产品里,混元获得的不只是一句“好用”或者“不好用”,而是一组带有对照关系的反馈:同一个任务,不同模型用了多长时间,采取