StepFun 的 Step 5 Preview 在 Artificial Analysis 智能指数上拿到 44 分,同类模型的中位数是 25 分。这个分数把它送进了 200 个模型的第 25 位。但真正让这份评测页面值得多看一眼的,不是分数,是它跑评测时吐出的输出量:1.6 亿,中位数只有 9000 万。
换句话说,这个模型很能说。单看价格,它便宜得不像话;把冗长算进去,账就没那么好看了。
分数怎么来的
智能指数 v4.3 不是单项跑分,它汇总了 10 项评测,覆盖代理知识工作、编码、终端使用、推理、知识和长上下文推理。页面里点名的几项包括 AA-Briefcase、GDPval-AA v2、Terminal-Bench 4.0、SciCode、Humanity's Last Exam 和 AA-LCR v1.1。
44 分放在这个综合口径下,属于同类模型里的上游位置。Step 5 Preview 是专有推理模型,采用扩展思维或思维链推理,支持文本加图像输入、文本输出,上下文窗口 1M,参数规模 6000 亿。权重不公开,只通过单一 API 提供商提供。
价格表里的三个数字
定价是这份页面里最直观的部分:
- 每 1M 输入 1.00 美元,中位数是 1.88 美元
- 每 1M 输出 2.70 美元,中位数是 10.00 美元
- 缓存折扣 95%,按 7:2:1 的缓存命中/输入/输出混合比例算,混合费率为每 1M 0.51 美元
输出价格只有中位数的四分之一多一点,这是它最扎眼的地方。跑一次完整的智能指数评测,成本是 918.34 美元。
便宜的单价比不过话多的总量
问题出在输出量上。评测期间模型生成了 1.6 亿输出,中位数是 9000 万,接近两倍的差距。页面把它的冗长度排在第 65 位(共 200 个模型)。
高冗长度会直接推高生产环境里的输出成本和延迟。单价低,不等于账单低——如果每次回答都要多吐一倍的量,省下来的单价会被总量吃掉一部分。这是这份数据里最容易被忽略的一层。
页面本身是仪表盘,不是评测文章
需要说清楚的是,这个页面的形态是数据仪表盘。内容多为交互式图表占位符、基准定义和常见问题解答,没有独立的编辑分析,也没有独立评测或方法论批判。它没有讨论局限性,没有失效模式,也没有超越聚合排名的具体竞品对比。
所以能确认的是数字:44 分、1M 上下文、6000 亿参数、1.00/2.70 美元的定价、95% 缓存折扣、1.6 亿输出量。至于这些数字在真实工作负载里意味着什么,页面没有给出答案。
在智能表现领先且价格合理的模型里,Step 5 Preview 被放在了领先位置。但冗长度这个变量,值得在下单前自己算一遍。
热门跟贴