打开网易新闻 查看精彩图片

“Token正在换主人。”

7月20日,在WAIC期间举行的无问芯穹AI基础设施论坛上,面对“Token涌现,万物生长”这一主题,曦望Sunrise董事长徐冰认为,Agent时代正在发生一个新变化。

过去三年,Token主要由人购买、阅读和使用;而随着Agent开始规划任务、调用工具、编写代码、自我检查,越来越多的Token将由机器生成、由机器消费,甚至不会被人直接看到。当Token的主要使用者从人转向Agent,支撑Token生产的芯片、系统和基础设施,也必须随之换代。

徐冰看来,这场变化,不只是一次需求增长,也意味着智能供给方式正在被重新定义。未来,数百亿Agent将持续运转,智能不再受人口数量和八小时工作制限制;Token将像水电一样成为基础资源,推理GPU则成为AI时代“发电厂”的核心部件。只有不断降低Token的生产成本,智能才可能真正变得便宜、稳定且到处可用。

打开网易新闻 查看精彩图片

在题为《为Agent造芯,与同路人共造》的演讲中,徐冰分享了曦望过去几年做GPU时看到的行业账本,也首次系统拆解了曦望第三代GPU S3背后的设计取舍:为什么重新选择内存,为什么裁掉训练模块,为什么重写互联,又为什么要为Agent的记忆建一套分层的“房子”。

徐冰表示,这既是一张面向Agent时代的芯片答卷,也是一份关于下一代推理基础设施的思考:当Token换了主人,芯片的评价标准、设计顺序和产业协作方式,都需要重新开始。

以下为现场演讲实录:

Token 已经涌现,但是支撑万物生长的基础设施,还没有定型。我用一句话来概括今天的判断Token 正在换主人。

过去三年,Token 是人买的、人看的;从今年开始,越来越多的 Token,人一眼都不会看——那是 Agent 在规划、在调用工具、在写代码、在自我检查的时候,机器烧给机器的。

Token 换了主人,为 Token 生产算力的基础设施,也得跟着换一代。今天我想把曦望这几年为 Agent 造芯片踩过的坑、算过的账,做过的取舍,摊开来给大家分享——既讲挑战在哪里,也讲机会在哪里。

先讲终局的判断。

第一,未来十年,地球上会出现数百亿个智能体,7×24 小时运转。真正的经济拐点,不只是 Agent 数量超过人类,而是 Agent 的工作小时数超过人类。智能将不再受人口数量和八小时工作制约束。

第二,如果电力是工业时代的基础能源,Token 就是 AI 时代的基础能源,推理 GPU, 是建设“发电厂”最关键的部件。

第三,百万Token 一分钱。今天行业的主流推理价格,离这个数字还差着数量级。但只有把推理成本从“元级”降到“分级”,AI 才有机会像水电一样,成为人人用得起的基础设施——普惠 AGI, 才真正触手可及。

所以,我们要建的不只是一颗芯片,而是 AI 时代的发电厂。我们从 2018 年开始做 GPU,2024 年独立运营;截至目前, 80%是研发。曦望国内首家确定“All-in推理”战略的 GPU 公司,目标很简单:把推理算力做得便宜、稳定、且到处可用。

今天想讲的,是我们做 GPU 这几年,亲眼看到的行业账本。

当智能成为可以采购的基础设施

为什么“把智能变成基础设施”,会是未来十年最大的一个场景?

三年前,顶尖智能主要依附在稀缺的人才身上。一个顶级程序员、资深分析师或者专科医生,要靠十几年培养,高端智力一直是奢侈品。

今天,顶级智能第一次变成可以按需采购的标准化商品。智能的供给方式,正从“稀缺人才”切换到“可采购的基础设施”。问题是,有供给远远不够。

黄仁勋今年 5 月接受彭博采访时说,即使供应链每年扩四倍,未来十年可能仍然不够 AI 使用。

智能第一次可以采购了,但全世界都买不够,这就是我们今天坐在这里的原因。

为什么是现在?有四个观察说明一件事:需求已经快速转向推理,供给仍然受到物理周期约束。

第一,上半年智能体应用爆发以后,推理算力租赁价格普遍上涨40%到100%,市场明显从买方转向卖方。第二,Claude从去年7月开始限流,到今天算力仍然是首要瓶颈。第三,推理需求已经达到训练的4到5倍;第四,CoWoS和HBM供给受限,缺口短期难解。

Token 需求按月指数增长,硬件供给按年建设。这就是当前的结构性缺口。

打开网易新闻 查看精彩图片

Agent 时代,被重新估值的内存

Agent 不是一个更大的聊天机器人,而是一个带状态、会持续工作的系统。它要同时保存模型权重、 KV Cache、工具结果和任务进度,还要能够随时暂停、恢复记忆。因此,内存越来越像数字员工的工位。

算力代表员工有多聪明,内存决定它能不能把资料摊开、把上下文留下,并持续完成一项工作。只有算力、没有足够多的工作空间,系统就会不断搬运数据、丢失上下文、命中不上缓存。

今年三星电子全年利润额有望超英伟达,海力士今年一季度利润率超英伟达,说明了一个市场信号:当内存成为系统瓶颈,利润和产业价值就会向瓶颈迁移。

对芯片设计者来说,这意味着:内存已经不是GPU的配角,而必须成为架构设计的最高优先级。

我们把一座 Token 工厂从上到下拆成六层: Token 服务、网络、超节点和GPU、内存供应链、 IDC 机房,电力。

真正稀缺的,集中在两类物理供给。一类是芯片和内存;另一类是一线高密机房及电力指标。上层服务缺的更多是变现和运营效率;网络不是短板;电力总量不缺,缺的是在正确的时间、正确的地点,把电接入高密机房。

所以,我们不能只盯着一张卡。真正要看的,不是峰值算力,而是在SLA约束下,最终交付了多少有效Token、完成了多少真实任务。

一座Token 工厂如何增产降本

拆完瓶颈,再讲方法。

一座高性价比Token工厂,有五个增产降本的杠杆:内存分层与晶圆效率;架构与软件;利用率与调度;以超节点为代表的系统工程;绿电直连。

它们可以归成两类。

第一类,是让同样的晶圆、内存和电力产出更多Token,包括内存与晶圆效率、架构与软件、超节点。第二类,是让已经买下的资产工作更久,包括调度利用率、机房和电力保障。

我想强调,容量与晶圆效率,是最大的杠杆。同样一片晶圆,走LPDDR路线比走HBM,多产出大约3倍的GB。内存全面短缺的今天,这3倍就是产能、就是Token——如何配比LPDDR和HBM,能把有限的晶圆转化为最多的Token,这是整座工厂的第一性原理。

而五个杠杆一起用,就是“百万Token一分钱”的路线图。

Agent造芯:S3的四项设计选择

这就需要介绍下我们在今年1月发布的第三代GPU——启望S3芯片。

今天我不逐项讲参数,而想把它当成一个公开样板,把我们为Agent造芯做过的设计决策,像开源文档一样摊开给大家看。

当时我们只问了一个问题——如果专门为Agent 时代设计一颗推理GPU,它应该长什么样?

最后形成了四个决策:换内存、裁训练、重写互联,还有给记忆分层。

第一个决策:换内存。

S3没有沿用全HBM路线,而是采用大容量LPDDR。

原因很简单:在很多Agent负载中,系统首先遇到的问题,正在从“算得够不够快”,转向“模型、上下文和KV Cache能不能装得下”。

同样一片晶圆,LPDDR路线可以多产约3倍GB。高通、英特尔、英伟达、苹果,全球巨头集体布局LPDDR,单卡容量都在几百GB的量级。全球厂商开始布局LPDDR,并不是替我们背书,而是说明大家看到了同一种负载变化。

S3支持96到576GB灵活配置。核心也不只是容量数字,而是:有限的晶圆,最终能够支持多少Agent 同时工作。

换内存是一场交易,我们把两边都讲清楚——先讲我们失去了什么。

我们损失了一项:显存带宽。LPDDR 的带宽确实比 HBM 低,这是物理事实。训练和极高带宽的场景,今天依然更适合HBM——所以这不是“LPDDR 取代HBM”,而是分工:PD分离、AF分离之后,不同的计算环节配不同的显存,两者互补。而在 Agent 负载上,用超大容量装下更多的 KV 和模型,这笔账是划算的。

用宽带,我们换回三样东西。第一,是容量的提升。内存是数字员工的工位,工位越大,一台机器养得起的 Agent 就越多,每个 Agent 记住的事就越久。第二,整卡成本结构性下降。LPDDR 加标准封装,不抢CoWoS,不抢 HBM 的配额,成本结构被重写。第三,自由。die不和 HBM 绑定,它可以独立销售,可以灵活定制。

第二个决策:裁训练,重做计算。

通用GPU训练、推理都要兼顾,拿来跑推理,算力经常用不满。S3反过来:先看Agent负载和核心算子,再决定晶体管往哪里放。

我们做了三件事。第一,裁掉不服务推理的训练态模块,提高单位面积的有效推理算力。第二,优化GEMM和Attention等核心算子的利用率。第三,支持从FP16到FP4的低精度推理。

我们不追求峰值TFLOPS,而是让每一颗晶体管,都在为有效Token工作。

第三个决策:重写互联。

Agent的一次任务,它会调用不同模型,访问多个工具,把请求路由到不同专家,并在节点之间移动大量KV Cache。所以在Agent时代,“算得快”还不够,“等得少”同样重要。

这一页分成三层。

底层是高速SerDes,解决卡间的物理传输。中间是基于以太网的超节点互联引擎,让节点之间能够更低延迟地访问和协作。最上层是软件定义互联,由模型结构和运行时决定什么数据在什么时间、以什么粒度移动。

在这种系统里,通信不再只是计算之外的一项开销,它本身就像一个重要算子。

第四个决策:给Agent 的记忆,建一套分层的房子。

热数据放GPU显存。温数据放CPU DRAM。冷数据下沉到 SSD,让历史会话持久化存放。

S3用上了最新一代的PCIe Gen6,IO带宽翻倍——这条通道,就是三层记忆之间的电梯。

超长上下文和持久记忆的底座,靠的不是把一层内存堆到极限,而是让每一层内存,干它性价比最高的活。我们把这些设计落地到一套超节点系统里,最终以系统级方案支持高吞吐推理。

客户真正关心的,也不是某个单卡指标,而是在延迟、质量和稳定性要求下,能不能服务更多Agent、完成更多任务。

所以未来推理芯片公司的能力边界,会从“卖卡”走向“定义系统”。

Agent 基础设施不会只有一种形态

S3用同一颗die,覆盖PCIe卡、OAM模组,以及32到256卡超节点。

它的价值是让软件栈、模型适配和运维经验能够复用。客户也可以随着业务增长逐步扩。开放、可组合、可演进,是Agent时代基础设施的重要原则。

回到长期判断。

推理基础设施有三重确定性:训练到推理的反转已经发生;先进制程和内存是物理瓶颈;算力正在进入国家级基础设施,与水电并列。这说明推理基础设施不是一轮短期行情,而是一项需要长期投入、持续交付和产业协作的工程。

这项工程,需要四类建设者。

  • 第一类,是Fab、内存、封装、服务器、IDC和电力,负责物理供给。

  • 第二类,是推理专用芯片。

  • 第三类,是推理框架、MaaS和Agent平台,把硬件变成可运营的Token产能。

  • 第四类,是光计算、存算一体、3D堆叠和具身芯片,探索下一代架构。

四类角色处在不同环节,但都站在同一条Token成本曲线上。没有任何一层,能够单独赢得Agent时代这也正是今天我们来到无问芯穹论坛的原因。

无问芯穹把复杂的、异构的算力,变成可运营的Token产能——这是Token工厂的生产与运营层。而曦望专注的,是把Token 的物理成本降下来——让Token工厂,拥有一颗成本更低的、Agent原生的发动机。

工厂越高效,越需要好的发动机;发动机越便宜,工厂的账越好算。所以我们和在座伙伴之间,是上下游的乘法关系。

最后,回到开头的问题——Token的新主人是谁?

越来越多地,Agent它需要的“家”,归结起来是四件事:记得住,协同快,算得起,结果可信。

Token已经换了主人,因此芯片的评价标准要变,设计顺序要变,产业协作方式也要变。我们愿意把S3背后的选择和取舍摊开来,作为一张可以被产业批改的答卷;也期待和各层伙伴一起,安安静静地把成本降下来,踏踏实实地把系统做稳定。

一家公司建不成Agent时代的基础设施。我们一起携手,与Agent共生,与同路人共造。

欢迎参与:2026第十六届中国国际纳米技术产业博览会

打开网易新闻 查看精彩图片

欢迎报名:ICDIA 2026 (第六届中国集成电路创芯大会)

打开网易新闻 查看精彩图片