过去三年,图形处理器(GPU)几乎垄断了大语言模型(LLM)的算力话题。在传统聊天机器人应用中,中央处理器(CPU)每次请求提供的算力占比极小,GPU则承担了绝大部分重活。然而,推理并非单一模型回答单一问题那么简单。随着对工具调用、多步推理以及跨多个小型专用模型编排的依赖日益加深,算力应该部署在哪里的算盘正在被重新拨动。
英特尔已明确指出了这一转变:CPU与GPU的配比正在从训练负载中的1:8,转向推理负载中的1:1,在部分智能体(agentic)部署场景中甚至达到4:1。这一组数字,正在动摇“GPU是LLM推理唯一正确答案”的行业共识。
为何GPU作为LLM推理首选方案的假设正被重新审视?CPU为何重获青睐?行业数据又揭示了什么趋势?
从底层逻辑看(无意双关),CPU与GPU解决的是本质上不同的问题。
现代GPU拥有数万个核心,设计目标是同时在数千个数据元素上执行同一操作。这使它们在Transformer推理前向传播中占据主导地位的密集矩阵乘法上快得惊人。在训练和高并发批处理推理中,这种并行性直接转化为吞吐量:更高的每秒token数(TPS),以及每一美元算力能服务更多请求。
相比之下,现代CPU拥有1到数百个核心,针对顺序、条件判断和分支逻辑做了优化,在单个操作穿越复杂决策树时尤其快。CPU还能直接访问主系统内存,无需像GPU那样经过PCIe总线拷贝数据,因此在需要频繁访问权重之外的数据、处理长上下文或执行多步逻辑时,CPU的内存带宽优势得以显现。
智能体推理的兴起正在改变负载结构。工具调用意味着模型需要生成参数、等待外部API返回、再根据结果决定下一步;多步推理意味着模型要反复在“思考—行动—观察”的循环中切换;编排多个小型专用模型则意味着大量轻量级调度逻辑。这些场景中,每一次单独的前向传播都可能是小批量甚至单条请求,GPU的并行吞吐优势被稀释,而CPU的低延迟、强分支处理能力和大内存带宽则成为更关键的指标。
行业数据也印证了这一趋势。英特尔给出的1:8到4:1的配比变化,标志着推理负载从“重并行”向“重逻辑”迁移。对基础设施团队而言,这意味着在规划算力时,不能再简单套用训练时代的“GPU优先”公式,而需要根据实际推理模式动态分配CPU与GPU资源。
当然,这并非宣告GPU出局。在离线批处理、大规模并行推理等高吞吐场景中,GPU依然是不可替代的主力。真正的变化是,算力布局从“GPU一边倒”走向“CPU与GPU各司其职”。当推理负载越来越像“带有数学运算的程序”而非“单纯的矩阵运算”,CPU的回归也就不足为奇了。未来,谁能更精准地匹配负载与算力,谁就能在AI推理的成本与速度竞赛中占得先机。
热门跟贴