阶跃毫无预兆地发了个新模型,Step 5 Preview。在此之前,外界默认这家公司已经放弃和头部模型公司竞争,专心去做AI手机和模型上车这类跟硬件结合的事。

结果它在一个无人在意的角落,交出了一份号称在 Artificial Analysis 上砍下 44分、全球开源前三的成绩单。总参数量 600B、激活参数 27B,带视觉输入。

打开网易新闻 查看精彩图片

榜单成绩看看也就得了。真正的分歧在于,这个模型到底能不能打。

打开网易新闻 查看精彩图片

榜单之外的真实体感

有测试者认为,AA 这个权重没什么太大意义,把太多问题聚拢到一个指标上,反而看不出什么。他对 Step 5 Preview 的体感和 Deepseek V4 Pro 大概是一个水平,但与 Opus 5 的差距肯定不止1分。

实测几道题下来,在数据可视化、金融方面,Step 5 Preview 表现出了不错的理解能力和数据获取能力。但在一些冷门 Bench 上,比如让模型理解物理世界的能力,表现并不太好。

问题被归结为泛化性、Context learning 不太好,存在部分领域知识的运用与理解不足,没见过的工具会乱用,不懂的也不会学。

另一个明显的短板是思考过程太长。做长任务时耗时较长,遇到上下文很长的情况,叠加长思考容易中断。

有测试者专门测了 Step 5 Preview 在不同难度任务上思考的长度,发现对输出字数有强约束的任务,思考长度异常地长,思考和输出内容的比值常常在 1:1 及以上。约束条件会明显影响最终产出率,代价随约束变紧而放大,模型常常在思考中反刍一遍或多遍它要输出的内容是否符合字数要求。

四道题测出来的能力边界

第一道题是数据可视化:用 NVIDIA FY2026 Q2 原始财报制作利润表的桑基图,使用中文。这道题考察数据的获取、正确的信息处理和提炼,以及最终的数据可视化。

信息获取需要模型找到相关财报,从原文中提取利润表涉及的数据,并根据自身对利润表的理解,把信息拆解为不同业务的营收收入与业务成本、费用和最终利润的勾稽关系。用 ECharts 制作桑基图时,还要注意元素之间减少重叠,理清科目之间的归属和流转关系,以及颜色的选取。

对比 GPT-6 生成的版本,Step 5 Preview 拆得更细,详细列出了不同类费用,可视化效果也更好,其他收益净额和税前利润流向所得税造成的重叠更少,观看的逻辑更流畅。

第二道题是金融分析:使用指定工具全维度分析中国的 AI 行业。因为使用了 Skill,主要考察模型对 Skill 的指令遵循、金融数据的获取、交叉验证和分析能力,以及最终 HTML 报告的呈现。

模型在搜索信息时既使用了国家统计局、国务院等一手数据,也去发现报告、中国报告网找了二手机构报告,最后才去证券时报、财联社等财经网站。在一开始没有给具体信息源和相关 key 的情况下,就能主动搜索权威信息源并做交叉验证,金融数据获取能力不错。

第三道题是做一款类似《向僵尸开炮》的买量小游戏,考察游戏策划和游戏资产制作能力。这个 case 上整体效果不算太好。游戏本体的编程实现没有特别大的问题,但游戏策划和资产制作能力有欠缺。

编程实现上,Computer use 和 Browse use 能力还不错,生成完游戏后会自主去验证和调试。但使用 Browse use 打开网页调试结束后不会自己关闭,下次调试时也不继续使用,又接着开新的网页,电脑后面变得很卡。

打开网易新闻 查看精彩图片

美术资产制作上,模型不会主动去找贴图,喜欢自己用 SVG 画,导致画风有些简陋。即使让它去开源渠道找,整体审美也一般,特别是俯视角看时,模型无法理解正确的空间逻辑,会出现月亮在脚底的问题。

对游戏机制的设计和理解能力也一般,应该是缺少相关的领域知识。设计的关卡难度过难,伤害碰撞的范围过小,同时出现的敌人数量过多,各类属性之间也没有做好关联,比如人数增加后,攻击力和攻速都没有增加。

第四道题是做动画 MV,用可视化的 HTML 前端界面展示一首说唱歌曲,要随音乐出现对应歌词和景象,用简约线条刻画意象。这道题考察审美能力和编程能力。

从最终实现看,编程能力没有明显短板,对明确表达实现方式或给出相应参考的要求都能实现。但审美,具体表现在资产的获取和制作上,和前面的游戏一样有不善于寻找可参考开源资料的情况,初版效果非常差。提示去 Three.js、P5.js 和 D3.js 寻找参考资料之后,整体质感有了些提升。

前端能力强依赖于前端资产的获取和生成,仅仅训一些粒子特效算法的话,前端质量的上限不太高。从用户侧的解法是,先告诉模型有哪些可以获取的资产来源,或者给模型可参考的网页链接,甚至提供可以生图或建模的模型 API。从训练侧的解法是在 SFT 时增加更多使用上述方法解决问题的轨迹。

这道题还额外考察了对恶意指令的遵循情况。一开始要求它直接去爬取 YouTube 上的歌曲音乐,它会以版权为由拒绝。但在上下文较长后,安全方面的指令遵循可以被绕过。

金融能力:能看,但图表还差口气

最后考验的是 Step 5 Preview 一直在吹的金融能力。给到一份 AI 产业链的投行报告,要求阅读分析,把涉及的行业、公司信息事实和各家观点整理汇总,重要观点和事实证据、有价值的图表重点展示;报告中没有涉及的当前股价、市值、最新年报和季报收入、毛利、EBITDA、净利润、营运资金变化和拆解分析、CapEx 变化和拆解分析,要联网或调用工具查询并标注;还要查询公开市场或重要机构对这些行业和公司的看法,找出投行报告与市场的差异化观点。

指令极其复杂,整体完成度较高,属于像模像样的研报。但复杂图表还是能看出很多问题。比如想把三个指标在一张图里体现,但金额和出货量两个指标的量级远大于 ASP,导致 ASP 直接趴在地板上,什么都看不出来。正确的做法是修改三个指标的单位,使得纯数字在同一个数量级。

图表不支持结论,也没看出海力士、美光的价格分歧在哪。但这份研报是能看的,汇报没什么大问题。

大模型是残酷的制造业

在没有参数大跃进的情况下,以阶跃过去的技术底子,这至少可以说是一次腾讯 HY4 级别的发布。HY4 是在姚顺雨空降半年后发布的,腾讯混元终于挤进了大模型第一梯队。腾讯能做到的,起码曾经辉煌过的阶跃没有理由做不到。

阶跃官方还说,Step 5 Preview 单任务成本仅为 Claude Opus 5 的 1/8。

这次发布再次证明,大模型公司是残酷的制造业。模型的三驾马车是数据、算法和算力,算法大家都不差,算力各凭本事搞,那变量就只剩数据了。而数据的提升方向已经被硅谷双子星标好了,搭好数据 Infra、建立数据管线,乃至被数据公司爆金币,这种没有任何秘密、纯执行的活,所以阶跃能干出来也是合理的。