打开网易新闻 查看精彩图片

芯片大牛 Gerard Williams III、John Bruno、Ram Srinivasan,这三个人物名字在芯片圈不算陌生。他们参与过苹果从 A7 到 M1 的多代 CPU 核心设计,后来创办 Nuvia,被高通以 14 亿美元收购,做出了 Oryon。今年 1 月他们离开高通,4 月成立了一家新公司 Nuvacore。

先说说这三个人做过什么,Gerard Williams 在苹果待了九年,是平台架构的高级总监,负责所有 CPU 和 SoC 开发。从 2013 年 A7 这颗苹果第一颗 64 位 Arm 处理器开始,到 A14,再到 M1 系列,这些芯片的 CPU 核心都和他有关。Cyclone、Typhoon、Twister、Hurricane、Monsoon、Vortex、Lightning、Firestorm,这些代号对应的是苹果每一代 CPU 核心。M1 Pro、M1 Max、M1 Ultra 这几款 Apple Silicon 平台也在他的职责范围内。

John Bruno 负责系统架构,之前在 Google、Apple、AMD、ATi 都待过。Ram Srinivasan 做的是性能架构,2014 年之前在 Intel,之后在苹果做了五年系统性能架构,然后加入 Nuvia 做性能架构。

2019 年,Williams 和 Bruno、Manu Gulati 一起创办了 Nuvia,目标是做面向服务器的 Arm 架构高性能 CPU 核心。产品还没上市,高通就在 2021 年初以 14 亿美元把 Nuvia 收购了。高通后来推出的 Oryon,就是来自这个团队。

Nuvacore 目前公开的信息不多,它的官网有一句口号,要改写硅的规则,还有一句是 Engineered for Altitude。公司的目标是要开发一款全新的通用 CPU 核心,从零开始设计,不做妥协。团队称将高度聚焦两件事,最大性能和绝对的面积效率。他们认为行业里的老牌公司只是在昨天的架构上迭代,在性能和功耗之间做平衡。Nuvacore 说自己要从底层重新设计,在所有方面都做到出色。

这家公司拿到了红杉资本的投资,还聘请了前苹果 CPU 工程负责人 David Williamson 担任硬件工程高级副总裁。从招聘信息看,他们在招分支预测、指令调度、寄存器重命名、乱序执行、加载存储设计、缓存和内存子系统、一致性、性能建模等方向的工程师,也在招 RTL、验证和物理设计的人,工作内容覆盖流片和芯片后验证。操作系统负责人、固件负责人、遥测和可观测性负责人、软件验证负责人这些岗位也在招。

让 Nuvacore 显得不太一样的,是它的设计方法。公司把方法叫 Core First,翻译过来就是核心优先。传统 CPU 设计流程是先选指令集架构,也就是 x86、Arm 还是 RISC-V,这个选择决定了整个芯片的设计方向。

Nuvacore 的做法是把指令集的选择放到最后。他们先设计 CPU 的基础模块,包括 CPU、NPU、GPU、内存控制器这些,先把核心本身的性能、能效和面积做到最优,然后再决定用哪套指令集。该公司称用这种方法,超过 95% 的处理器核心基础模块可以独立完成。

这个思路的出发点是,现在的 CPU 设计被指令集绑得太紧了。一旦选定 Arm 或 x86,很多微架构上的选择就受限。Nuvacore 想先把硬件本身的潜力挖出来,再考虑软件兼容的问题。

他们也承认,指令集不能简单地在最后阶段加到核心上,解码、特权级别、内存顺序、异常处理、软件兼容性这些仍然对设计构成重大限制。不过在他们看来,性能关键的机制可以在指令集确定之前先开发出来。

Nuvacore 的产品叫 WarpCore,公司目前没有透露它最终会用哪套指令集。招聘材料里提到 RISC-V、Arm64 和 x86 都和工程工作相关,说明底层设计留了灵活性。这里有一个法律问题还没解决,RISC-V 相对简单,不需要 Arm 式的架构许可。基于 Nuvacore 自研微架构的 Arm 实现,需要在某个环节拿到 Arm 的架构授权。

考虑到 Arm 过去和高通、Nuvia 之间的法律纠纷,这件事可能比较棘手。x86 的门槛更高,实现权受到严格控制。所以还有一种可能,WarpCore 会成为可复用的 CPU IP,供拥有相应架构许可的合作伙伴去适配。

该公司的长期商业模式也还没完全明确。它可能做完整的 CPU,可能做可授权的核心 IP,可能做半定制芯片,也可能是这三者的组合。

此外,工艺节点、缓存层次结构、流水线配置、向量功能、流片计划这些关键细节都还没公布。它刻意保持指令集决策开放,这让它成为目前在研的 CPU 项目里比较特别的一个。

为什么现在要做这件事,其实这和智能体 AI 的兴起有关。Nuvacore 表示,他们的目标工作负载不只是标准的数据中心任务,而是为高级 AI 系统和智能体计算的高强度、持续性需求专门设计的。

智能体系统和传统数据中心工作负载不太一样。它不会处理一批任务就结束,它会持续运行。它要在跨越数小时甚至数天的对话里保持上下文,不断从内存里提取推理轨迹,刷新向量存储,在决定下一步之前检查已有知识。这些内存访问不规则、不可预测,和 CPU 缓存架构师过去三十年优化的那些清晰、可重复的模式不太一样。

智能体还要调用多个工具,启动子智能体,等待响应,把结果反馈到下一个决策里。同时它还要和旁边的 GPU、底层存储架构、连接其他系统的网络共享资源。这个循环里任何一点效率损失都会累积。在生产规模下,数百万个智能体交互同时运行,对延迟和一致性的要求超出了现在服务器 CPU 的设计能力范围。

当前的服务器 CPU 针对可预测的企业级工作负载做吞吐量优化,客户端 CPU 针对突发性能和激进的电源管理做优化。这两种设计都很难完美匹配需要持续、高效、低延迟地协调数百万次智能体交互的处理器。Nuvacore 的判断是,市场上还没有人真正从根本上构建适合智能体 AI 的处理器。

这个判断能不能成立,要看几个问题能否处理好。Nuvacore 团队的过往业绩主要在客户端,不在数据中心。他们的声誉是在苹果建立的,苹果为封闭生态设计芯片,散热、工作负载、软件栈都是已知的,客户也只有苹果自己。

Nuvia 当初立志进军数据中心,在产品推出前就被收购了。高通实际推出的是 Oryon,一款优秀的笔记本芯片,仍然属于客户端。

另一个问题是,数据中心准备好迎接下一代芯片了吗?数据中心架构师并不闲着,首席信息官们已经疲于应对现有系统的管理和新一代 AI 基础设施的融合。一款新设计的 CPU 要进入数据中心,通常依靠超大规模数据中心把它作为定制芯片采用,依靠成熟的 OEM 厂商承诺围绕它构建平台,或者依靠性能和效率差异足够大迫使成本压力促使厂商重新评估。Nuvacore 要走上这条路,需要在交付量产芯片之前就赢得超大规模数据中心的设计订单或OEM 合作,而这款产品至少还要两到三年才能流片。

在数据中心领域,从引人注目的架构概念到合格且可部署的 CPU 之间,有一段大多数雄心勃勃的芯片公司都保持沉默的距离。Nuvacore 的 Core First 方法和 WarpCore 核心,目前给出的是一套思路和一个方向。它能不能把纸面上的架构自由度,变成真实数据中心里稳定运行的芯片,还要等它拿出流片和客户之后才有答案。

参考资料:

https://www.bloomberg.com/news/articles/2026-04-15/sequoia-backed-chip-startup-nuvacore-looks-to-overhaul-cpus-for-ai-era

https://www.tomshardware.com/pc-components/cpus/legendary-qualcomm-apple-and-nuvia-alumni-form-new-cpu-startup-nuvacore-promises-to-rewrite-the-rules-of-silicon

注:封面/首图由 AI 辅助生成

打开网易新闻 查看精彩图片