随手先关注,不错过每日AI热讯速递
2026 年 8 月 13 日美东时间(北京时间 8 月 14 日凌晨),OpenAI 联合 AI 芯片公司 Cerebras 推出旗舰模型GPT-5.6 Sol的全新服务层级——「Ultrafast(超高速)模式」(一个跑得比标准模式快得多的推理档位)。在该模式下,模型输出速度最高可达750 tokens/秒(token 是大模型处理文字的最小单位),较标准模式约 53 tokens/秒的推理基线提速最高14 倍,且不牺牲模型智能水平[1]。
①
速度数字背后发生了什么?Ultrafast 的算力来自 Cerebras 的晶圆级引擎(Wafer-Scale Engine)(把整个芯片做成晶圆大小的处理器架构),每片晶圆级芯片集成了44GB 片上 SRAM。GPU 架构下,大模型推理的瓶颈在于模型权重在片上内存与片外存储之间反复搬运;Cerebras 把整个模型的权重常驻在片上 SRAM 中,消除了这个带宽瓶颈[1]。
横向对比(基于 Artificial Analysis 数据):Ultrafast 的速度是Claude Fable 5 的 11 倍,是Claude Opus 4.8 Fast 模式的 5 倍[1]。
②
最能说明问题的对比是 HLE(Humanity's Last Exam,2500 道博士级题目)实测
Cerebras 工程团队将 Ultrafast 后的 GPT-5.6 Sol 与直接竞对做了对照,GPT-5.6 Sol Ultrafast 用时11 小时 11 分钟跑完全部 2500 题,而 Claude Fable 5 用时78 小时 27 分钟(超过三天连续计算),两者准确率相当,速度差距约7 倍
在衡量经济价值工作的 GDP-Val 基准上,Ultrafast 实现了5.6 倍端到端加速,且质量无损失[2]。
图:Cerebras 官方博客「Accelerating GPT-5.6 Sol Ultrafast with OpenAI」配图,深色背景配白色大号无衬线粗体标题文字(来源:Cerebras 官方博客 [2])。
③
三件事需要冷静看待。其一,当前为有限预览——Cerebras 算力容量有限,Ultrafast 当前仅向精选客户开放、可登记候补,规模化与定价策略均未公开[1]。其二,速度对比口径需厘清——「14 倍」是相对标准模式约 53 tokens/秒的峰值口径,HLE 基准是 Cerebras 单方做的对照,第三方独立复现尚未见[2]。其三,OpenAI 内部已先行使用——研究员 Jeffrey Wang 表示,任务「在我还没机会切换上下文之前就完成了」,极大提升效率[2]。
④
回到核心问题:当智能体(能自主完成多步任务的 AI 系统)能在 11 小时 11 分钟里跑完博士级题目评测,速度维度上的大幅领先意味着什么?下一步要看 Cerebras 的算力扩容节奏,以及 OpenAI 是否愿意把 Ultrafast 开放给更多客户。在此之前,Ultrafast 仍是少数人的「速度特权」。
希望对大家有所帮助。欢迎在评论区分享你希望看到下一个跑出 14 倍速度的模型。
参考来源:
[1] Cerebras 投资者新闻稿 Cerebras Powers Ultrafast Mode for OpenAI's GPT-5.6 Sol
https://investors.cerebras.ai/news-releases/news-release-details/cerebras-powers-ultrafast-mode-openais-gpt-56-sol
[2] Cerebras 官方博客 Accelerating GPT-5.6 Sol Ultrafast with OpenAI
https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
欢迎分享、点赞、推荐
一起拥抱AI
热门跟贴