编辑:前沿在线 编辑部
最近跑了一圈国内头部互联网数据中心服务商和大模型企业,一个很明显的感受是:行业的焦虑已经从 “模型效果追不上”,变成了 “落地成本下不来”。
不少智能体项目死在试点转规模化的阶段,卡的不是模型能力,是基建效率。
这次来苏州逛 Intel Connection,重点就盯了算力中枢・AI 工厂和企业 AI两大核心展区,两者都属于数据中心(Data Center)业务线的展示范畴。
逛完的结论很明确:智能体的下半场竞争,正在从上层的应用创新,下沉到底层的数据中心基建比拼。
谁先把基建的标准化、成本、效率跑通,谁才能在智能体规模化阶段拿到真正的优势。
算力中枢:智能体时代的数据中心,正在走标准化的路
我在算力中枢・AI 工厂展区停留了最久。
做了这么多年科技产业报道,我太清楚智能体规模化最大的坑在哪:从来不是芯片峰值性能不够,是每个项目都要从头搭一遍基建。
不同客户有机柜规格差异,供电散热要单独设计,软件栈要逐项适配,最后算下来,基建适配吃掉小半工期,推高一大截成本,都是行业常态。智能体要从试点走向规模化,这道坎必须迈过去。
开放 Agent 机柜:在定智能体时代的基建规矩
所以第一个抓住我视线的,就是英特尔开放 Agent 机柜平台。
这东西看着低调,其实是本届展会最有行业影响力的展品之一,它不是又一款新机柜,而是在给智能体时代的 CPU 机架定标准。
有数据中心行业分析师做过测算,智能体定制化部署中,机柜、供电、软件栈适配等基建环节的成本占比超过四成。
这也是为什么行业都在等一套通用标准,标准统一带来的成本下降,长期来看可能比单芯片性能提升的影响还要大。
英特尔拉着立讯等伙伴一起推的这套 CPU 机架标准,把纯 CPU 托架分成了性能优化型和密度优化型两个方向,专门针对微型虚拟机(Micro Virtual Machine,MicroVM)沙箱运行做了深度调优。
目标很明确,在卡死服务水平协议(Service Level Agreement,SLA)要求的前提下,把沙箱启动规模拉到最大。内存配置、供电功率也做了梯度化设计,不同场景按需选择。
现场标的参数很有说服力,一颗至强 6 + 就能扛 1000 多个智能体,200 毫秒拉起沙箱,部署密度 350 个,是同类竞品的 1.46 倍。
但比参数更重要的是标准本身的价值。这是一套开放的行业标准,全行业都能照着做,都能适配。
以后智能体部署不用再每个项目 “自盖毛坯房”,从定制工程变成标准化拼装,工期和成本都有机会往下掉一大截。
这对整个数据中心行业来说,是影响格局的变化,有点像当年个人电脑从定制化走向兼容标准的那个节点。
算力形态分化:从超大型节点到办公室的全覆盖
有意思的是,这套基建标准不是只服务超大型数据中心,两头都照顾到了,对应的其实是智能体时代算力需求的分层。
一头是集装箱式储能算力一体化方案,主打大型算力节点的快速部署。
不是简单把服务器塞进箱子,而是把变电、储能、算力整套集成进标准集装箱,做了绿电直连优化,配套 5MWh 储能削峰填谷,打通从电力到词元的全链路。
工厂预制完拉到现场一周就能投用,不用花一两年建机房,相当于把大型算力工厂做成了可复制、可移动的标准模块。
双碳背景下,绿电消纳和算力布局的匹配一直是行业难题。
传统数据中心建设周期长,很难跟上绿电资源的布局节奏。集装箱式的模块化方案,相当于给了行业一个可快速复制的绿色算力模板。
另一头是英特尔 TBX16 词元一体机,瞄准的是中小企业本地化部署。
16GPU 配置,专门做了静音优化,不用专业机房,办公室里就能放,一站式覆盖全量级大模型本地推理需求,相当于把数据中心级的推理能力,做成了可办公落地的轻量化产品。
中间还有 GPU 整机柜集群、全闪存储集群,以及液冷、高速互联、供电组件一整条配套生态。
逛完这片最大的感受是,英特尔不是在卖单款硬件,是在搭一整套面向智能体时代的数据中心基建体系。
从芯片到整机,从单机到集群,从超大型节点到小型桌面级部署,整个算力工厂的产品谱系是完整的。
企业 AI:拼的是智能体的算力经济学
顺着展区往里走就是企业 AI 板块,和算力中枢区没有明显隔断,逻辑上也是顺的:底下基建搭稳了,上层智能体的运行效率,才是接下来比拼的核心。
很多人算智能体成本,只算 GPU 的采购价。
但真正跑过规模化部署的都懂,沙箱启动慢吃掉的算力、键值缓存(Key-Value Cache,简称 KV 缓存)膨胀挤占的资源,才是隐形的成本大头。
这也是我认为企业 AI 展区最有价值的两个方向:沙箱效率和缓存优化,本质都是在算智能体的算力经济学。
沙箱效率:直接决定单智能体的部署成本
针对沙箱这个智能体的核心运行载体,英特尔是从效率、可观测、安全三个维度全给了方案。
英特尔内存分析加速器(Intel In-memory Analytics Accelerator,简称 IAA)加速安全沙箱给我的印象很深。
技术思路很巧妙,用 8×32k 并行流水线,把压缩解压的延迟完全隐藏在存储 IO 内,几乎零额外开销,CPU 占用不到 1%,内存不到 1MB。
实测 64 到 128 个并发场景下,快照恢复快 39% 到 56%,保存快 50% 到 60%,规模越大收益越明显。
放在智能体的成本模型里看就更清楚。
沙箱是 Agent 的工作单元,启动速度直接决定单机能承载多少并发 Agent,也就直接决定单 Agent 的部署成本。
IAA 把快照 IO 开销打下来,本质是把 Agent 的单位成本打下来了。做大规模 Agent 部署的人,都懂这意味着什么。
安全这块也不是应用层打补丁的思路。
Agent-CC 可信智能体直接基于可信域扩展(Trust Domain Extensions,简称 TDX)硬件级可信执行环境,给推理、数据处理、工具调用做全链路机密保护。
现在企业上智能体最大的顾虑之一就是数据合规,尤其是 Agent 调用工具、处理敏感数据的时候。
传统应用层加密有性能损耗,也有逻辑漏洞,从数据中心基建层就把安全兜住,比事后一层层补补丁,逻辑上要稳得多。
KV 缓存:长上下文时代的成本核心
而 KV 缓存全链路优化,我觉得是今年所有做推理的企业都该重点关注的降本抓手。
不少推理服务商私下算过账,长上下文多轮对话场景下,KV 缓存挤占的显存和算力成本,已经接近甚至超过了模型推理本身的消耗。
这块降不下来,推理单价就打不下去,智能体规模化就永远卡在试点阶段。
英特尔这套是从数据中心全链路解的,从压缩、复用、聚焦到扩展,四层分别对应不同问题。
底层靠英特尔快速辅助技术(Intel QuickAssist Technology,简称 QAT)和英特尔数据流加速器(Intel Data Streaming Accelerator,简称 DSA)技术做无损压缩和高速碎片传输,几乎不额外耗 CPU。
中间有专门的 G3.5 存储方案做缓存卸载,补上传统内存和通用存储之间的性能空档。
不够还能靠计算快速互联(Compute Express Link,简称 CXL)内存池化继续扩展。整套下来传输速率最高提 9.66 倍,首字时延最多降 15 倍。
本质上这是在用存储层级换成本,用更低成本的存储介质承接缓存压力,把显存解放出来做计算。
这不是一个普通的组件优化,是整个总拥有成本(Total Cost of Ownership,TCO)优化的核心抓手。
换算到企业视角就是,同样的数据中心硬件成本,能扛更多并发,直接降推理 TCO。
一点观察:基建才是下半场的核心
再往里走还有行业 AI 和物理 AI 展区,工业、医疗、零售、机器人、车载这些落地场景都有,做得也扎实。
但在我看来,这些都是上层建筑。底下的算力基建稳了,场景落地只是时间问题。
在不少行业观察人士看来,2026 年很可能成为智能体的 “基建元年”。就像云计算早年经历过从定制机房到标准化云基建的阶段一样,智能体现在也走到了同样的关口。之前拼的是谁的模型更有想象力,接下来拼的是谁的基建更有成本效率。
对于数据中心行业来说,这更是明确的信号。
智能体时代的数据中心,早已不是简单堆算力的时代,而是拼体系、拼标准、拼成本、拼规模化能力的时代。
这很像云计算早期的那个节点。当时数据中心行业从传统托管机房,走向标准化的云基建。现在智能体时代,数据中心也正在从 “算力仓库”,走向 “智能体工厂” 的标准化。
英特尔这次展出的,本质上就是新一代数据中心基建的标准底座。
以后看智能体项目,别光盯着表面的功能有多花哨。
往下多瞅一眼,底下的数据中心基建扎不扎实,才是真正决定能走多远的东西。
点「在看」,给前前加鸡腿
热门跟贴