作者:快思慢想研究院院长 田丰,每日经济新闻 郑欣蔚
开篇 传播最快的是分数,最难核实的是分母
大模型行业有个心照不宣的规律:评测分数负责上热搜,分母负责被追问。
9月20日,正处于赴港IPO(首次公开募股)关键窗口的阶跃星辰,发布新一代开源旗舰基座模型Step 5 Preview:总参数600B,激活参数27B,稀疏MoE(混合专家)架构,100万Token(词元)上下文。在全球权威的Artificial Analysis综合智能指数(下称AA指数)上,它拿到44分,跻身全球开源模型前三。
图 Artificial Analysis网站
这次发布最响亮的数字另有其人:单任务成本仅为Claude Opus 5的1/8。阶跃星辰的解读是,同样成本能换来更强智能,同等能力能以更低成本投入实际工作,“进一步推动AI模型的帕累托前沿”。
帕累托前沿本是经济学里的一条边界线,线上的每一点,想再改进一项指标,就得牺牲另一项。换成大模型的语言,一头是钱包,一头是智商。阶跃星辰想证明,这条线还能往外推一推。
从今年2月的Step 3.5 Flash、5月的Step 3.7 Flash到这次的Step 5 Preview,阶跃星辰三代基座反复追问同一件事:怎样把每一份算力,更划算地变成智能?
答卷成色如何?“1/8”的分母靠不靠得住?快思慢想研究院院长田丰在接受《每日经济新闻》记者采访时,先给了一句评语:“这是一次教科书式的达标交卷,但离真正的代际跃迁还差一步。”
一、榜单上的一分之差,多半只是统计噪声
先看分数。AA指数上,Step 5 Preview与Kimi K3同为44分,智谱GLM-5.3为45分(精确值44.9分),DeepSeek V4.1 Flash为39分。国产模型里,排在Step 5 Preview前面的只有45分档的Qwen3.8 Max和GLM-5.3。
图:阶跃星辰官网
名次泾渭分明,统计学却不太买账。田丰指出,Artificial Analysis官方方法论披露,该指数的95%置信区间小于±1%。44分、44分与44.9分,差距大概率落在统计噪声里,好比早高峰挤进同一节车厢的三位乘客,很难说清谁先上的车;44分与GPT-5.6 Sol的47分之间,才大概率隔着真实的距离。
诺贝尔经济学奖得主丹尼尔·卡尼曼与合作者阿莫斯·特沃斯基,曾把一种常见偏差命名为“小数定律”:人们总爱从有限的数据里读出过多含义。“媒体喜欢把‘名次’读成‘代差’,这是一种系统性误读。”田丰说。
节奏又把含金量摊薄了一层。国产大模型进入“月更”乃至“周更”的锦标赛,三个44分级模型挤在同一格,任何一次“进前三”的边际信息量都在缩水。古德哈特定律说得透:指标一旦成了目标,就不再是好指标。
田丰的判断是,Step 5 Preview更接近一次节奏性更新;算不算实质跃迁,要看下一代模型环比提升的斜率能否跑赢行业均线。
二、同样的44分,一个在打“新地基”,一个在“精装修老房”
总分相同,长相可以南辕北辙。
与近期引发广泛关注的2.8万亿参数模型Kimi K3相比,Step 5 Preview以约五分之一的参数体量拿到同分。智能体编程任务上,Step 5的吞吐量为每秒99.8个Token,约为K3(每秒39.3个)的2.5倍;按AA测算的单任务成本,Step 5是0.71美元,K3是2美元。K3也有看家长板:长上下文测评AA-LCR拿到89%,Step 5尚未公布对应成绩。
“一个总分背后,是两种完全不同的能力配方。”在田丰看来,与其争谁更强,不如问谁更适合干哪类活。
两个44分档位的“成色”也不同。据智谱联合创始人唐杰公开表述,GLM-5.3沿用GLM-5.2基座,纯靠后训练把编程能力拉高了50%;Step 5 Preview则是一次全新的基座训练。
田丰比喻为:“一个是老底子上的精装修,一个是新地基上的毛坯房,谁的进步更扎实,答案不言自明。”
纯后训练路线的投入产出比正在变得极具竞争力,这本身就是一个值得警惕的信号。装修队干活的速度,正在逼着打地基的人加快进度。
三、被资源逼出来的节俭,最后练成了看家本领
阶跃星辰的算盘写在明处:过去Scaling(规模化扩展)靠用更多计算换更强智能,如今模型变大、任务变复杂,算力账单水涨船高,下一阶段的关键是提升算力转化为智能的效率。当Agent从“回答问题”走向“完成任务”,主力模型要在能力、成本、效率与场景覆盖之间找平衡。
田丰的评价是:“资源受限倒逼出来的战略选择,倒逼久了,练成了看家本领。”相较头部厂商,阶跃的算力禀赋并不占优。这与任正非讲的“备胎计划”逻辑相通:家底不厚,就把算力用在刀刃上,长出“少算力、高转化”的工程能力。生存选择做到极致,便成了差异化优势。
参数曲线就是账本。Step 3.5 Flash总参数196B、激活11B,Step 3.7 Flash为198B、激活11B,两代体量几乎原地踏步,刻意保持规模、死磕效率;到Step 5 Preview才真正扩容至600B、激活27B。这条路没有一路线性放大稀疏度,先在小规模上练到位、验证清楚,再决定扩不扩容,比“越做越大”多一层资源集约、自我约束。
在田丰看来,这是行业规律使然。他援引Anthropic CEO达里奥·阿莫代伊的判断:规模定律没有失效,但算力转化为智能的效率,正成为新的竞争维度。芯片史演过同样的剧情:2005年前后“登纳德缩放”失效,摩尔定律下堆晶体管的边际效益递减,竞争焦点从“数量”转向“每瓦性能”。“阶跃只是在这条曲线上跑得比较早、比较坚决的一个,方向是行业的必然,节奏是阶跃自己的选择。”
四、便宜要看跟谁比,数字要看怎么算
亚马逊创始人杰夫·贝佐斯有句名言:“你的利润就是我的机会。”拿市面上最贵的模型之一做参照,是展示性价比最省力的办法。阶跃星辰选中的,正是Claude Opus 5。
换个参照系,画面就变了。此前DeepSeek已用V4系列的极致低价,重新定义了开源模型的成本地板。AA测算口径下,参数规模相近的DeepSeek V4.1 Flash完成标准智能任务的加权平均成本为0.27美元,Step 5 Preview为0.71美元;API单价上,V4.1 Flash输入0.3美元、输出1.2美元,Step 5 Preview分别为1美元和2.7美元。田丰直言:Step 5的“低价”只是比贵的模型便宜,并未触及行业真正的成本地板,“这是一句需要辩证来看的话术”。
算法同样要追问。上一代Step 3.7 Flash那组广为流传的“1/9成本、97%能力”,田丰查证官方博客原文后发现,出自一种名为Advisor Mode的混合调用策略:Step 3.7 Flash跑出76.3%、0.19美元,对照的是Claude Opus 4.6同策略下的78.7%、1.76美元。换到标准SWE-Bench Pro测试,Step 3.7 Flash裸成绩56.3%,Claude Opus 4.7为64.3%,实打实差了8个百分点。阶跃尚未披露“1/8”的测算口径。
五、价格是牌桌的入场券,技术代差才是护城河
成本优势到底值多少?田丰的定性是:它能帮你坐上牌桌,却很难一直守住城池。
第一道坎是硬件规律。推理硬件的性能提升速度,决定了全行业推理成本大约每12到18个月下降2到3倍。这是行业级的潮水,任何一家公司都挡不住。今天的价格代差,明天会被整体成本下降自然填平。
第二道坎是生态。巴菲特把企业持久的竞争优势比作“护城河”,任正非讲“力出一孔,利出一孔”。成本优势要沉淀为壁垒,得配上规模化的分发渠道与生态绑定:Claude靠企业级Agent生态的粘性,DeepSeek靠庞大开发者群体形成的路径依赖。阶跃手里主要还是价格这一张牌,牌面单薄,既可能被更大玩家的补贴战淹没,也可能被行业成本曲线抹平。
好在价格战本就不在阶跃的主牌里。成本优势是结果,效率是方法;低价标签来得快、散得也快,持续下压成本曲线的工程能力却能留下来。阶跃要比的,是在同样的参数体量下跑出更强的智能。田丰的结论是:真正能沉淀为壁垒的,只有持续跑赢行业均线的技术代差,价格代差撑不了太久。
六、编程赛道上,分数撬不动开发者的“肌肉记忆”
阶跃星辰把Step 5 Preview的重点检验场景锚定在AI编程和金融,这个组合耐人寻味。田丰的总评只有四个字:知易行难。
编程是大模型商业化最成熟的场景,也是最拥挤的红海。IDC数据显示,2025年中国AI编程市场规模为3.99亿元,预计2026年底将飙升至11.73亿元,接近3倍。阿里在这一市场占有近50%份额;在SWE-bench上长期领先的智谱GLM系列在企业级市场攻城略地;Kimi以超长上下文建立差异化口碑;DeepSeek同样拥有大批开发者拥趸。
Step 5 Preview的答卷并不寒碜:软件工程测试DeepSWE v1.1得分67.7%,略高于Kimi K3与GLM-5.3。
可田丰提醒,用户心智早已变成一道“转换成本”的经济学题。智谱的GLM Coding Plan、Kimi的K2/K2.7已扎根于开发者的IDE插件、订阅习惯与工作流,就算Step 5 Preview分数打平甚至反超,迁移也意味着重新集成工具链的沉没成本。诺贝尔经济学奖得主赫伯特·西蒙说过,信息的丰富造成注意力的贫乏。模型越多,开发者的注意力越金贵。
更要紧的是,编程智能体的胜负手已转向agentic loop(智能体循环)能否稳定跑通、工具调用会不会中途“掉链子”。田丰指出,Claude Code团队的产品实践说明,决定用户留存的是端到端的可靠性。“阶跃不能只拿分数吸引开发者迁移。”
七、金融这片“蓝海”,早已泊满了先到的船
金融是另一个故事。阶跃星辰选它做核心验证场景,看中的是难度:金融连接宏观经济、政策监管、行业周期与公司经营,要求模型兼具专业知识、跨行业理解、证据核验与复杂问题拆解能力。Step 5 Preview在金融基准测试Frontier Finance上的得分,高于GLM-5.3、Kimi K3与DeepSeek V4.1 Flash。
可蓝海并不空旷。9月17日,Kimi发布金融行业解决方案,涵盖超10项权威数据源、9项金融技能、5项合规安全措施,以及机构级数据建模和报告交付能力,同时官宣数十家金融机构合作伙伴;它已接入Wind、标普,与中金、中信建投、蚂蚁集团均有合作。智谱已在多家银行部署落地,绑定中泰证券,今年6月又与中国银联签署战略合作协议。券商们也在自研垂类模型与智能体工具。
大洋彼岸同样热闹。Anthropic今年5月推出金融版Claude(Claude for Financial Services),9月再推面向理财与金融顾问的Claude for Financial Advisors;OpenAI也在9月推出金融版ChatGPT(ChatGPT for Financial Services)。截至今年7月,金融服务与保险已占Anthropic年度经常性收入的25%,仅次于编程与软件工程的36%;Anthropic内部预计,金融有望在2027年反超编程,成为其最大的垂直应用市场。
八、后来者的船票,是先学会被别人集成
阶跃星辰创始人、CEO姜大昕近日公开表示,垂类大模型正与金融行业生产系统加速融合,背后是模型从单点应用能力向基础设施的跃迁。
方向没错,时钟却不等人。田丰认为,金融看似蓝海,拼的其实是生态,模型分数排在后面。先发者的生态绑定已筑起时间壁垒:金融机构的合作决策,通常要走1到2年的数据安全与合规审查。阶跃作为后来者,即便模型能力对标Opus,也大概率错过了先发红利期。
他给出的路线图很务实:比起直接拿下金融机构的订单,更现实的是凭性价比“被集成”进别人的方案里。先借船,再造船。
归根结底,阶跃要证明的,除了测评分数上的领先,还有模型与智能体产品能否嵌入更多金融机构的核心业务。编程赛道的心智壁垒需要时间去撬,金融赛道的落地需要案例去证。
从Step 3.5 Flash到Step 5 Preview,阶跃在效率赛道上的执行力足够坚决,这一次也把自己重新送进了开源第一阵营。可执行力与胜利之间还隔着一段路,从“第一阵营”到“不可替代”,难题还摆在桌上。
结语 斜率决定速度,口径决定信任
Step 5 Preview的数据是真实的,工程是扎实的。它是阶跃星辰在效率这条自选赛道上又往前跑的一步,但改变竞争格局,还要看下一次。
当“月更”成了常态,“分数领先”这件事越来越不值钱。真正值钱的,是在成本曲线与智能曲线之间,持续跑出比对手更陡的斜率。
分子决定一家公司能跑多快,分母决定它说的话能被相信多久。
参考文章:《“单任务成本仅为Claude Opus 5的1/8”,阶跃星辰Step 5 Preview跻身全球开源前三:榜单之外,场景落地仍需攻坚》, 每日经济新闻 郑欣蔚
畅销书:《AI商业进化论:“人工智能+”赋能新质生产力发展》
出版社:人民邮电出版社
作者:田丰
帮助你定位AI当下发展坐标的指南针
帮助你洞察AI未来演进趋势的航海图
通俗化解读AI的原理、特性和四大发展规律、提供AI赋能商业、引发新质生产力变革的一手案例分析。既有宏观视角的全局观照,又有各行业应用层面的下探记录,聚焦AI的原理与实践、现在与未来,是当下AI应用的全景图、更是身处AI技术浪潮之中的探路书。
热门跟贴