想象一下,一个智能体正在后台默默处理你的请求:它在沙箱里运行代码,实时调用外部工具,从数据库检索上下文,分析结果,再交给大模型做下一步决策。这个过程中,传统观念认为AI全靠GPU,但英伟达却发现——智能体的关键执行路径,越来越多地压在了CPU上。

于是,Vera CPU来了。7月21日,英伟达发布技术博文,详细拆解了这款专为智能体AI打造的新型处理器。它最抓眼球的数字很简单:88个Olympus核心,接入高达1.2 TB/s的LPDDR5X内存带宽。比数字更值得留意的,是整个设计围绕一个核心命题:满负载下,如何让每个核心都保持高速运转?

打开网易新闻 查看精彩图片

智能体工作负载有几个死穴。一,即使整个插槽被占满,也需要极强单线程性能,因为软件不能无限并行。二,每个核心必须有足够内存带宽,才能源源不断地给大批活跃执行上下文喂数据。三,并发下的延迟要可预测,否则智能体无法稳定走完预设步骤。四,要高效处理包含大量不规则控制流、长依赖链和指针密集型数据结构的代码。这些痛点,成了Olympus核心的工程设计起点。

Olympus核心把流水线切成四部分:前端、核心中段、执行引擎和缓存子系统。前端里藏着一个10宽的解码引擎,每周期能处理最多2个已采用分支,而分支预测子系统内置了神经分支预测器,专门应对复杂分支模式带来的预测失准。整套设计让88个核心、176个SMT线程能在单线程高负载与多线程高密度两种场景间灵活切换,同时减少线程间资源争抢。

数据怎么搬?英伟达拿出了一套名为可扩展相干互连(SCF)的片上网络。它提供最高3.4 TB/s的双向分区带宽,并把164 MB的统一L3缓存铺在所有核心之间,让核心、共享缓存、内存控制器、I/O和NVLink-C2C接口能高效对话。内存这边,Vera CPU用的是SOCAMM2形态的LPDDR5X内存,聚合带宽跑到1.2 TB/s,摊到单核上是14 GB/s。这套供数能力,瞄准的就是高并发AI、分析、图计算和强化学习这类吃数据吞吐的负载。

扩展性也没落下。Vera CPU支持双