WORKBUDDY × HY4 混元 Hy4 preview 开始独立交活 49B 激活 · 1M 上下文 · 31.8% 提速 模型 × 产品 × 工作流,闭环交付 MODEL CAPABILITY · DELIVERY PARAMS 770B / 49B CONTEXT 1M WORK MODE SELF CHECK EXECUTION RUNTIME HY4 × WORKBUDDY REPORT PPTX WEB GAME

3 PARTS · CONTENT MAP

PART 01

发布拆解

770B、49B、1M

PART 02

四场景实测

研报、展馆与游戏

PART 03

独立交付

模型 × 产品 × 工作流

大家好啊,我是甲木。

这几天的模型发布是真的多...感觉这个月在扎堆发布新模型,而且国内一个比一个猛,

这段时间一直在 WorkAgent 里泡着。写蓝皮书那会跑了几十个任务,后面日常也在用,算是比较熟了。

8月28号腾讯混元发了 Hy4 preview,当天我就试了下。

打开网易新闻 查看精彩图片

提升幅度有点超预期。之前用 Hy3,我基本当它是“需要带教的新人”,简单杂活能接,但碰到多文件协作、稍微复杂的任务就得人盯着,经常中途卡住要救。

Hy4 preview明显不一样,会主动建校验脚本、会回头核数字,更像是能独立交活的人。

看一眼官方 benchmark,Hy3 到Hy4 preview几乎每项都是台阶式跳升:

打开网易新闻 查看精彩图片

而且最主要的是:WorkBuddy 又开了两周免费。现在干活多多少少都要用 AI,很多人等于花钱上班,WorkBuddy免费一开,大量办公族就涌进来了。

打开网易新闻 查看精彩图片

Hy3 那波也是这个打法,但 Hy3 能力上限摆在那,用户进来了,很多场景接不住。

Hy4 preview 的打击面不一样了,多文件、跨文档、长程任务都能接了。同样免费,能做的事多了一圈,留下来的概率就不同了。

模型升级 + 免费拉新,连续打,「为生产力而生」

口号挺大的,先来看个创意前端:

这些都是 Hy4 在 WorkBuddy 里一句话跑出来的,我们直接拿真活试。

01

PART

这次发布讲了什么

Hy4 Preview · WHAT'S NEW

先简单过一遍发布内容。

770B 总参,激活 49B,上下文 1M。官方主推四个方向,除了我实在不太懂的科研..外,其他的都测了:

01

办公分析

数据分析、跨文件协作到文档/表格/PPT 完整交付。

02

游戏开发

一句话出可玩原型,多轮迭代。

03

软件工程

长程开发和前端审美。

04

科研

分子动力学、凝聚态物理这些,跳过。

有两个点值得单独提。

这个模型完成了自进化。
Hy4 preview参与了自身的研发:怎么训、用什么数据、怎么评估、底层怎么优化,它自己提方案、跑实验、看结果再改。之前 OpenAI 和 Anthropic 都提过类似的事,现在混元也做到了,官方第一次把这个写进发布口径。

打开网易新闻 查看精彩图片

还给自己提了速。模型自己找推理环节哪里慢,优化了六轮,整体速度比基线快了31.8%。

打开网易新闻 查看精彩图片

内部盲测:163 名专家、203 个工程任务,均分 2.99/4.00,略优于5.3和K3等其他几家模型。

定价:输入 ¥6,输出 ¥18,缓存 ¥0.3(每百万Token),这么来看Hy4 preview 在国内旗舰模型中定价是最低的了...

打开网易新闻 查看精彩图片

节奏上:2月重建基础设施到现在,混元平均两个月一个大版本,preview 先行、正式版跟进。

这个飞轮想清楚了其实挺恐怖的:模型越好 → 用户越多 → 数据越多 → 模型更好。

免费把人拉进来用,用的人多了,真实场景的数据和反馈就多了,下一版模型就训得更好,用户每隔两个月就感觉到“又变强了”,然后继续用,这就是一个正向飞轮~

02

PART

WorkBuddy + Hy4 preview四大场景实测!

WorkBuddy × Hy4 Preview · REAL TEST

CASE 01

AI 情报局:两份真财报 + 30 条热点 → 研究报告 + 汇报 PPT

给它腾讯和阿里的真财报 PDF 加本周 AI 热点 30 条,让它出研究报告(docx)和汇报 PPT(pptx),每个数字注明出处到页码。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

45 分钟跑完。它自己建了校验脚本核数据,还建了渲染脚本把 PPT 逐页出图自查。复核轮查出阿里财报两处口径不一致,自动修正了。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

CASE 02

青花志:非遗数字展馆

最近做case真的做到吐太多,模型要测了,也不知道做什么好。

正好看到官方推文做的是天坛,就想着我们也参考着做个非遗方向的,做一个青花瓷数字展馆。三个展厅从元代逛到清代,纹样全部程序画,不许贴图。

打开网易新闻 查看精彩图片

这个 case 最大的亮点是 SVG 能力。它自己画的青花瓷纹理非常好,缠枝莲、龙纹这些细节都能出来,比那种糊成一团的矢量图强太多了。

打开网易新闻 查看精彩图片

同样的 prompt 拿 Hy3 跑过一遍做对比:

打开网易新闻 查看精彩图片

CASE 03

弹窗大作战:复古 OS 梗

流氓弹窗疯狂蹦,关闭按钮会躲鼠标,点错原地分裂。撑过 90 秒不蓝屏就赢。全套 Windows 95 复古窗口,98.css 和像素字体全部内联,断网双击就能玩。

打开网易新闻 查看精彩图片

VIDEO · 16:9 横版视频

打开网易新闻 查看精彩图片

这个 case 的亮点在它的工作方式。它花了很长时间自己建测试、跑校验:三种打法各跑一局(认真撑、完全不管、专点身子触发分裂),确认三种结局都能跑通,还测了手机端触摸和 26 个弹窗同屏的压力上限。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

对现在的顶级模型来说,这种"做完了自己检查、自己测"已经快成基本能力了。真正能拿来用的长程调度,就是这个样子。

CASE 04

窑变:烧瓷小游戏

和青花志组成非遗双 case。玩家当窑工,按住"添柴"控温,松手自然降温,90 秒烧完一窑。贴合度决定开窑成色:90% 以上发色纯正,中间档偏色带开片,烧过头直接窑塌给你一堆碎片。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

03

PART

结语

Final Thoughts · 以上

办公 Agent 这个赛道,今年进入了拼交付的阶段。

之前各家发模型,比的是跑分、参数、上下文长度。但跑分高不代表能干活,很多模型拉到真实场景里,该卡的还是卡。

Hy4 preview这次让我觉得不太一样的地方是,它的工作方式变了。

AI 情报局那个 case,它自己建校验脚本核数据、自己渲染 PPT 逐页走查;弹窗大作战,它花了很长时间建三套测试方案,自己跑完确认没问题再交。这些事以前都是人盯着做的,现在它自己闭环了。45 分钟出两份能交差的文件,中间不用人插手。

打开网易新闻 查看精彩图片

「为生产力而生」这种口号谁都能喊。

但生产力落到实处,靠的是模型、产品、工作流三件事能对上。

腾讯现在的做法是把模型直接塞进 WorkBuddy,用户不用管底层换了什么,打开就是新的。

打开网易新闻 查看精彩图片

在最新的榜单中,腾讯混元 Hy4 preview 登上 Code Arena WebDev 榜单第 5 名,开源模型中位列第 3。

我们一直都说:让 AI 走进真实业务场景中。Hy4 preview已经基本能做到不需要回头再次 check,虽然还差最后几步。

毕竟还是 preview,复杂任务偶尔会过度自我验证,跑着跑着绕进去。

但按目前的迭代节奏,正式版应该不远了。

以上。

打开网易新闻 查看精彩图片

我是甲木,热衷于分享一些AI干货内容,同时也会分享AI在各行业的落地应用。觉得有用的话,点个赞、在看、转发三连,谢谢大家。