AI推理速度的竞赛又有了新玩家。Cerebras公司近日发布了其新一代机架级解决方案CS-4,宣称在推理任务上比传统GPU系统快最多30倍。这家专注于AI推理加速的公司,正在用一套完全不同的硬件思路挑战现有格局。
CS-4的核心:三颗晶圆级芯片
CS-4单套系统搭载了3颗Wafer Scale Engine 3 Turbo(WSE-Turbo)处理器。每颗晶圆芯片的速度达到前代产品的2倍。配合全新的电源、冷却和I/O系统,Cerebras称成功进一步挖掘了单颗晶圆的性能潜力。
这套系统的关键指标相当突出:在超过10万亿参数的模型上,CS-4每秒可处理1000个以上的token。Cerebras的表述很直接——“GPU系统根本无法以这样的速度生成token”。
30倍速度与10倍能效的双重提升
Cerebras在官方公告中给出了更具体的对比数据:相比传统GPU系统,CS-4的token生成速度快最多30倍;而对比自家上一代CS-3,每瓦特吞吐量提升了最多10倍。公司还特别强调了一个商业逻辑——高速token比低速token更有价值,在有限电力预算内,CS-4能提供更多高价值token,从而提升数据中心盈利能力。
“AI基础设施过去一直被迫在低延迟交互和高总吞吐量之间二选一,CS-4改变了这一局面。”Cerebras在声明中表示。
硬件设计的两个关键改动
CS-4在物理设计上有两个值得关注的改动。一是组件数量削减了50%,将晶圆、电源转换、液冷、高速I/O和控制电子元件整合进一个紧凑的3D封装中,制造和部署周期因此大幅缩短——从过去的数天压缩到数小时。
二是电源与处理器的物理距离被压缩到仅0.5毫米,而传统GPU板上这一距离约为50毫米,差距接近100倍。Cerebras称,这一设计将电力损耗几乎降为零,同时使可供给的电力翻倍。
出货时间与市场背景
按照Cerebras的计划,CS-4的首批出货将在本季度内启动,即2026年9月底之前。公司还表示,这套方案在超大规模环境中的维护和未来升级也会更简单。
值得注意的是,Cerebras近期动作频繁。此前已有消息称其与AMD合作,计划在2026年下半年推出超低延迟AI系统;OpenAI也与Cerebras签下了规模达1.5万亿日元的多年期合同,用于扩展实时AI能力。这家自称“地球上最快AI芯片”的公司,正在加速进入主流视野。
热门跟贴