周三下午,在首尔江南区一栋不起眼的办公楼里,Rebellions CEO Sunghyun Park 用一句话点出了当前AI芯片市场最深刻的裂痕:“训练和推理,根本就是两种不同的物理。” 这句话的背后,是整个行业正在经历的一次结构性转弯——曾经大一统的算力竞赛,正被两个越来越难用同一块芯片解决的现实问题撕开。

Park 给出的解释很直白。训练是“造模型”,只发生一次,参与的机构就那么几家,而且研究的方向随时可能调整,所以需要极致的计算灵活性。但推理是“用模型”,每一次查询、每一笔交易、每一个决策都在发生推理,对效率的要求完全不是同一个量级。“你不可能让同一块芯片,既要能灵活地跑几千亿参数的训练任务,又要在每一次回答用户问题时把功耗压到最低。”他说。

打开网易新闻 查看精彩图片

这组对立直接体现在功耗数字上。Rebellions 给出的对比:他们的推理机架功耗约在16到20千瓦,而当前主流基于GPU的推理系统,机架功耗普遍要爬到120千瓦上下。对于绝大多数企业应用场景,120千瓦的算力实际上是严重的“能力溢出”,不仅浪费电,更把推理成本推到了一个让很多中小企业望而却步的水平。Park 提到,Rebellions 的机架价格也大致只有相同算力规格GPU方案的三分之一左右。“这不是简单的降本,是在为更多普通企业打开真正能用得起AI的大门。”

除了功耗和成本,内存成了另一个让推理硬件不得不走上另一条路的关键变量。当前动辄万亿参数的大模型,正在把现有硬件架构中计算与内存的耦合关系推到极限。Park 说,Rebellions 选择了与SK海力士和三星深度合作,不是被动地去响应某一家芯片厂商在内存规格上的变动,而是主动去对齐多条技术路线图。“这样做的目的,是让推理芯片的设计不再被某一家内存的路线图牵着鼻子走,而是形成一个更稳定的、可以持续优化的生态节点。”

从更宏观的视角看,Park 看到了两个正在同时发生的转变。第一,训练硬件和推理硬件的设计需求正在“急剧分化”——训练仍然需要旗舰级的灵活算力,但推理会催生一批以每瓦性能、每token成本为核心指标的轻量级芯片。第二,跨领域的路线图对齐——不仅仅是计算和内存,还包括互联、封装、甚至冷却方案——正在成为决定谁能率先把真正高效的推理芯片推向市场的核心能力。“过去那种非黑即白的芯片制造格局正在被打破,未来不会只有一种赢家。”Park 说。

值得注意的是,Rebellions 并没有试图去否定训练芯片的价值。Park 明确表示,训练仍然需要最顶级的计算资源,这方面的竞争不会降温。但他同时强调,AI 的价值最终要落在“用起来”这件事上,而“用起来”的主角不是实验室,是每一个需要实时响应、需要考虑成本的企业和开发者。当推理的效率成为AI落地的真正瓶颈时,为推理而生的硬件就不再只是大厂的降本备选,而可能成长为一个真正独立的增量市场。