大模型上下文窗口正快速从数百K冲向1M级别,长文本输入带来的算力消耗与首字时延压力持续攀升。摩尔线程最新发布的《MTT S5000 Prefill-as-a-Service 技术白皮书》直指这一瓶颈,提出将推理过程拆解为两个独立资源池,试图为企业级AI推理服务找到一条兼顾效率与成本的新路径。
结构性错配:算力与带宽的双向浪费
白皮书点出了当前推理服务的核心痛点——结构性错配。在大模型在线推理中,输入阶段的Prefill(预填充)属于计算密集型任务,受浮点算力约束;而输出阶段的Decode(解码)则是访存密集型任务,受显存带宽约束。这两类任务在同一物理资源池中混跑,必然导致双向浪费:按Decode带宽选型,Prefill的大容量显存长期低效;按Prefill算力选型,Decode计算单元则大面积空转。
这种“通用冗余”的部署模式,在上下文规模快速膨胀的当下,正日益成为制约企业推理服务效率与总拥有成本(TCO)的关键因素。
解耦方案:两个资源池各司其职
摩尔线程给出的答案是彻底解耦。白皮书提出,将Prefill与Decode分别部署在各自最契合计算特性的硬件资源池上:
- Prefill算力池:专攻高算力利用率与极低首字延迟(TTFT);
- Decode资源池:专攻高并发与稳定的每Token延迟(ITL)。
通过硬件分层投入,算力配置从“通用冗余”转向“按需匹配”,在满足服务质量(SLO)约束的前提下,实现单位Token基础设施成本下降。
面向AI Agent与超长文档的落地路径
这一新范式瞄准的并非泛泛的通用场景,而是AI Agent、代码生成、超长文档分析等长上下文推理场景。这些场景的共同特征是输入规模大、对首字时延敏感,恰恰是传统同构集群最难啃的骨头。摩尔线程基于旗舰级AI训推一体智算卡MTT S5000构建的“Prefill As a Service”范式,为行业提供了一条兼顾推理效率、成本控制与算力变现的可落地路径。
白皮书全文已随公告一并公开,感兴趣的开发者可以直接查阅完整技术细节。
热门跟贴