智能体规模化落地,最先撞上的不是模型能力的天花板,而是延迟。模型训练是标准化、可并行的批量任务,核心目标是提升整体吞吐量;智能体则是典型的串行状态机,每一步执行都依赖上一步的输出,任意环节的微小延迟都会沿任务链路层层放大。传统CPU一味追求平均吞吐的优化思路,在这个场景下已经不够用了。
稳定、可控、超低的端到端延迟,成为智能体规模化的硬性约束。与此同时,硬件负载的矛盾也在加剧:高并发工具调用与高带宽AI推理需要在单芯片内混跑,二者对内存资源的需求相互冲突,叠加多租户场景下的安全隔离与资源独占需求,传统CPU架构的短板被彻底暴露。
数据中心被拆成三类集群
在9月22日的Connection大会上,英特尔给出的判断是:推理时代,CPU正从配角变为整个系统的控制中枢。英特尔数据中心集团副总裁、中国区总经理陈葆立表示,未来的数据中心将被拆分为三类集群——负责智能体执行和任务编排的CPU集群、负责模型推理计算的GPU集群,以及承载长对话、文档等持续新增业务数据的存储集群,三类集群之间的数据调度全部由CPU完成。
落到产品上,采用Intel 18A制程、最高拥有288个能效核的至强6+处理器配合智能体套件,单颗即可部署近千个智能体。英特尔给出的实测数据是:在SWE-bench测试中,其单智能体性能领先竞品15%;在云端沙箱场景下,面对10分钟内批量启动上万沙箱、单沙箱延迟200ms以内的要求,至强6+支持350个沙箱并发,性能约为竞品的1.46倍。
三个环节,CPU的价值被重新定价
除了智能体编排,CPU在三个具体环节上的作用也被放大。
- 异构数据预处理:智能体需要抓取网页、视频、PDF等素材并做文本提取,这类任务GPU并不擅长,至强AMX加速器让向量化和重排序分别达到基准的2倍和4倍。
- 存储调度:从HBM到DRAM再到本地SSD,成本和延迟呈反向变化,CPU作为核心调度者,联合焱融科技基于至强6和MRDIMM的方案,在MLPerf Storage v3.0中拿下了Llama3检查点读写和3D-Unet训练两项全球第一。
- KV Cache管理:面对百万Token上下文约300GB的容量,英特尔的KV Cache智能加速套件通过QAT实现无损压缩,将300GB原始数据压至200GB,并借助DSA引擎将数据搬运最高加速9.66倍。
把这些环节串起来看,结论是清晰的:GPU承载推理运算,CPU既要承担基础计算,更要扛起全局调度管控。随着业务规模扩张,这套调度工作的复杂度呈指数级攀升。
物理AI:让机器人跳舞容易,做精密操作难
数字AI的战场在云端,物理AI的征途在真实的物理世界。英特尔副总裁兼端侧计算和物理AI事业部中国区总经理高嵩在大会上表态,希望当大家提到物理AI时,第一个想到的厂商是英特尔。
物理AI与数字AI的核心差异在于,机器人必须与真实物理环境交互。行业里一个现实的痛点是:让机器人跳舞容易,做精密操作难。难点在于控制,动态环境下的实时感知与精准执行仍是巨大瓶颈。
第三代酷睿Ultra的应对方案是大小脑融合。依托XPU异构架构,推理决策与实时运动执行被整合在单颗SoC上:CPU作为小脑,以4kHz的控制频率每秒完成4000次动作调整,保障关节电机精准响应;GPU承载高阶AI推理,在Pi0.5精度下推理时延仅为78毫秒,低于人类视觉200-250毫秒的平均反应时间;NPU面向视觉感知,YOLOv12n推理仅需3.55毫秒,每秒处理约280帧,远超普通摄像头60帧的输出上限。
传统方案需要多个独立单元分工处理感知、决策和控制,不仅响应慢,还容易出现协同偏差。单芯片整合后,工程师得以将精力从底层调优转移到上层智能开发。
成本是另一道坎。具身智能的Token消耗随用户量线性增长,某具身企业创始人透露,工程师一下午的训练就能烧掉数百美元。英特尔的思路是通过硬件负载整合降低底层开销,将推理决策和运动控制统一到单颗SoC的异构架构上,从硬件层面压缩算力冗余和能耗,把整体拥有成本拉到可商业化的区间。
算法路线未定,用生态广度对冲
具身领域目前没有统一范式,世界模型、VLA等路线仍在并行演进。芯片架构设计周期长达两到三年,押错路线的代价极其高昂。
高嵩给出的思路是辩证的:不仅要倾听客户的声音,更要有自身的战略判断,用内部的前瞻视角结合架构优化,与最广泛的生态合作,找准技术落地的正确方向。英特尔的差异化策略是不盲目追随单一算法路线,而是以开放的架构和生态,支撑多种算法范式的并行验证与快速迭代。
目前,英特尔已联合科通工业、神州数码等合作伙伴推出基于第三代酷睿Ultra平台的具身智能开发套件,并携手多家伙伴面向制造、建筑、医疗、智慧城市、仓储物流、酒店等场景推进项目从原型走向量产。英特尔同时宣布,具身套件将于11月在京东上线。
在AI从算得快走向干得了活的今天,系统设计的重心正在向执行面迁移。数字AI侧,推理和智能体部署放大了CPU侧的系统工作,x86在控制面、生态适配和基础设施软件上的存量优势正好能接住这个需求;物理AI侧,则用异构SoC缩短机器人的感知-决策-控制闭环,靠生态广度对冲算法路线的不确定性。
热门跟贴