作者:姚金鑫-J叔( Johnson_in_AI )

我有一个习惯,隔几天和业界大佬们坐会儿,聊聊天。之前ARM中国的CEO Allen Wu,本身也有在投资一些项目,有一次去找Allen的时候,他提到了之前Tenstorrent的Ljubisa Bajic,说离开后搞了个新项目还是做AI芯片,只是说要把AI模型直接固化在芯片里,出厂之后就不能再改了。

Allen问我怎么看。

就像我之前专门写文章分析Groq( )一样:只要别考虑泛化能力,性能和产品化大概率会非常好。至于生意做不做得成,那就是另一回事了。

后来, Ljubisa 真的把芯片做出来了。而就在昨天,AMD宣布把这家公司整个买了下来,这家公司叫Taalas。。

整个公司只有二十几个人,没有公开的大客户,唯一的产品HC1,规格看起来也很粗糙:N6工艺,815个平方,530亿个晶体管,功耗250W左右,但,没有HBM,没有外部DRAM,只能运行一个模型,Llama 3.1 8B。

打开网易新闻 查看精彩图片

当大多数厂商(尤其是国产AI芯片厂商)还在拼命增加通用性、支持更多模型、更多精度、更多算子的时候,Taalas朝着完全相反的方向走向了另一个极端。

那这件事情就有意思了,老读者应该知道,我这个核芯洞察公众号的一贯调性,就是从一些行业发生的蛛丝马迹里,找到一些可以窥视发展趋势的信号。

今天我们就来核芯洞察一下:为什么一颗只能跑一个模型的芯片,开始有了真实的产业价值?

一、把模型刻进芯片:一次极端的取舍

稍微先做个铺垫,解释一下一般的GPU是怎么跑模型的。

模型的权重(也就是训练出来的那几百亿个参数)平时存放在HBM这种高速内存里。推理的时候,GPU不断把权重从内存搬出来,送进计算单元做矩阵运算,算完再取下一批。换模型,本质上就是换一份权重数据。

这套模式最大的好处是灵活:同一颗GPU今天跑千问,明天跑DeepSeek,后天跑一个刚刚发布的新模型,硬件不用动。

凡事都有代价,每生成一个Token,都要把海量权重在内存和计算单元之间搬一遍。这就像一个厨师做每一道菜,都得把整个仓库的食材搬到操作台上再搬回去——搬运本身消耗了大部分时间和电力。

Taalas的做法是:不搬了,把食材直接砌进灶台。

HC1把Llama 3.1 8B的权重写进了芯片内部的Mask ROM(掩膜只读存储器),连一部分数据流的走向都跟着一起固化。芯片一旦流片完成,它天生就是一台Llama 3.1 8B推理机,不是"被配置成",而是"就是"。

想换模型怎么办?改两层掩膜,重新造一批芯片。Taalas给出的周期大约两个月。

这当然把GPU最值钱的通用性彻底扔掉了,trade-off换来了:

  • 不需要昂贵的HBM;

  • 不需要CoWoS这类先进封装去连接计算芯片和内存;

  • 权重不再来回搬运,省时间和功耗;

  • 那些原本为了"可编程"而付出的面积、控制逻辑和调度开销,也可以省了。

打开网易新闻 查看精彩图片

看看这么极致的效果,按照Taalas公布的夸张数字:在1K输入、1K输出的Llama 3.1 8B测试中,单用户可达16,960 tokens/s,每百万Token成本0.75美分。

不过这个数据出自Taalas自己的测试,可能需要打折看,毕竟模型可能被激进量化,上下文长度也很短,和真实生产环境差距不小。但即便打上很大的折扣,它依然说明了一件事:

模型必须随时可换这个约束,本身就吃掉了AI芯片相当大的一部分性能空间。

这才是Taalas真正有意思的地方。它在思考一个新问题——AI芯片,到底需要多通用?

二、旧思想遇上新时机:Agent把Token速度变成了钱

平心而论,Taalas的技术思想并不新鲜。专用ASIC、Gate Array,这些概念在半导体行业里存在了几十年,成功和失败都有案例。

现如今,变的不是技术,是工作负载。

本来嘛,AI基础设施的重心在训练。大家关心的是用多少张GPU、多大算力、多少HBM,可以把更大的模型训出来。芯片的通用性在训练场景里是刚需——模型结构天天在改。

当大模型进入大规模应用,推理的分量迅速上升。而Agent的兴起,又把推理系统的性能要求整个换了一套。

大模型在传统聊天场景里,真正的瓶颈是人的阅读理解速度,一秒生成50个Token还是150个Token,对读的人来说体验差别有限,人机交互带宽有点窄。

Agent不一样,它不用给人看,它给自己看,机器的理解速度那就不知道高到哪里去了。

假设一个Agent要连续执行50个步骤,每步产生500个Token,一次任务就是顺序生成25,000个Token:

  • 200 tokens/s:需要2分钟;

  • 1,200 tokens/s:需要20秒;

  • 12,000 tokens/s:理论上2秒。

同一个任务,用户体验从"泡一壶茶回来看结果"变成"点一下就出来"。当AI开始替人连续调用工具、写代码、查资料、跑分析,Token的生成速度本身就变成了商业价值——这也是NVIDIA为什么要把Interactivity(每个用户每秒拿到多少Token)单独拎出来,作为AI服务的一个等级指标。

打开网易新闻 查看精彩图片

问题在于,GPU想把单用户的Decode速度继续往上推,越来越难。

Decode阶段天生受制于内存带宽。而模型越大,参数就必须切分到更多GPU上,于是每生成一个Token,都伴随着GPU之间的大量同步和通信。以DeepSeek-V3这类大型MoE模型为例,Tensor Parallel带来All-Reduce,MoE的专家分发与回收又制造出大量All-to-All流量。

计算单元越强,这个矛盾越尖锐:在众所周知的内存墙之外,一道通讯墙正在浮现。

于是我们看到了一批思路完全不同的推理架构:

  • Groq:把权重塞进片上SRAM,用容量换极低延迟;(请看我之前的分析文章)

  • Cerebras:整片晶圆做成一颗芯片,从物理上消灭多芯片通信;(请看我之前的分析文章)

  • Taalas:更极端,干脆让模型成为芯片的组成部分。

这些案例可以看出:推理时代的AI芯片,正在从对泛化能力的要求,扩展到把某一类Token生产任务做得更快、更便宜的要求

三、AMD如何定位Taalas?

此前不久其实就在不久前,AMD刚刚宣布与Cerebras合作。按双方公开的架构设想,Helios负责Prefill(把长长的输入一次读进去),Cerebras负责高速Decode(一个一个往外吐Token)。按说AMD应该不缺一个高速的Decode方案,这个位置已经有人了。

那他为什么收购Taalas呢。所以J叔认为Taalas在AMD有更明确的定位

打开网易新闻 查看精彩图片

一:技术应用: Speculative Decoding

这里不得不提一下最近开始火起来的Speculative Decoding(投机解码),它的逻辑是:让一个小模型飞快地写出一批候选Token,再交给大模型一次性验证。小模型只负责快,不负责对;大模型只负责审,不负责写。

举个例子:让一个打字飞快但不太可靠的实习生先出草稿,资深专家审一遍——审稿比重写快得多。其实现在很多人的AI写作也差不多是这个意思!

这么看来,这简直天然是Taalas完美匹配的场景。小模型、版本固定、长期运行、只求速度——其他所有对Taalas的要求,在这个场景下都被削弱了:Draft Model本来就该长期冻结,模型能不能随便换无所谓。就算偶尔出现一些错误,验证模型也会把错的Token直接扔掉。

二:系统视角:MoE专家引擎

这一条其实更值得每一个芯片产品经理关注。

大型的MoE模型有海量的Expert参数。训练一结束,这些权重基本就固定不动了;而每个Token,只会激活其中很少的几个Expert。

想象一个几百人的专家团,每来一个问题只找其中两三位,而每位专家的知识库常年不变、被反复查阅。

对应到推理过程对芯片硬件的需求,数据量大、内容固定、反复读取、稀疏访问这四条,正好是ROM最擅长的活。

顺着这个思路,未来AMD的推理系统可以把Transformer从中间拆开:

AMD的GPU负责Attention和KV Cache(管记忆),Taalas负责FFN或MoE Expert(管知识),两边只交换中间的Activation。

NVIDIA已经在Rubin与Groq LPX的组合中公开提出了类似架构,叫Attention-FFN Disaggregation,简称AFD。

如果AMD也沿这条路走,Taalas的定位就完全不同了。它不必独立扛起整个模型,也不必自己保存动辄几十万Token的KV Cache——它只需要把自己最擅长的那一段做到极致。

三:商业模式:AMD最熟悉的半定制生意

AMD在过去的显卡时代,一直在给PlayStation和Xbox做半定制SoC,客户提需求、承诺采购量,AMD按需求定制芯片。这是AMD在业内做得最顺、也最赚钱的一门生意之一。

AI时代很可能出现同样的模式。

一家超大规模云厂商或模型公司,冻结一个准备用6到12个月的模型版本;AMD提供标准的Helios计算系统,同时为这个特定模型定制一层Model-Specific Silicon。

这样一来,Taalas就不再是一颗只能跑一个模型的怪芯片,而是AMD整套AI系统里的一个可定制模块。

这门生意,从系统视角的商业模式来看,那比单独卖HC1值钱得多,关键是,可以在AI factory这个世代,逐步蚕食Nvidia英伟达的份额。

这才是最重要的一点,也是我们这篇核芯洞察分析文章中最为创新且独立的视角!

四、Transformer正在被拆开,计算解耦是趋势

计算解耦是J叔这两年最常说的话题(内含解读P-D分离的文章:),借着这次的收购我们再深入地掰扯一下。

打开网易新闻 查看精彩图片

我们习惯把一颗GPU当作模型运行的基本单位,Attention、FFN、KV Cache、权重、控制逻辑,全部由同一种计算平台包办。AFD这类架构开始动摇这个习惯,因为这些工作负载本来就完全不同:

  • Attention:高度依赖KV Cache,上下文越长,越吃内存容量和内存带宽;

  • FFN / MoE Expert:本质是在大量固定权重上做矩阵计算,吃的是算力密度;

  • 投机解码的小模型:只要求极低延迟,对容量和算力都不敏感。

以前之所以都塞进GPU,技术上的原因主要是因为芯片之间通信太贵,拆开不划算。现在模型规模越来越大、Token速度要求越来越高,把不同的活交给不同的硬件,经济上的意义更合算。

这样一来,就很明显可以看到一个趋势,以后的AI计算计算系统就得解耦,需要从单一加速器走向解耦式AI系统。

那如果计算一旦被拆开,系统就会遇到另一个问题:芯片之间,怎么连?

如果GPU保管KV Cache、Taalas负责Expert,那么每生成一个Token,Activation都要在两边跑一趟。此时决定系统性能的,是一批过去容易被忽略的指标:带宽、延迟、抖动、带宽密度,以及每比特传输的功耗。

这就是另一个趋势:AI Fabric的地位也会快速上升。AI计算越异构,Fabric越关键。

今天这类连接还能靠高速以太网、PCIe和专用Scale-Up互联撑住。但当解耦从芯片级扩展到板级、机架级乃至超节点级,铜互联在距离、功耗和带宽密度上的压力会越来越难掩盖。

Optical I/O、NPO、CPO,以及更彻底的光Fabric,会因此拿到新的系统级需求。从这个角度看,光互联未来要干的事远远超出连接GPU,它要连接的是性质各异的计算资源、内存资源,和各种各样的专用加速器。

J叔正在做这项工作,所期望努力达到的目标,其长远意义就在于此。

五、Taalas的这笔交易,对AI芯片产业的三个启示

最后我们聊聊这笔交易对我们的启示,毕竟产业分析是咱核芯洞察这个号最基本的调性!

打开网易新闻 查看精彩图片

第一,GPU之外的架构创新空间,比想象的大得多。

芯片产品经理们,不要只想着做一颗国产GPU。随着推理占比上升,值得做的事情还挺多:Decode Engine、KV Cache系统、MoE Expert引擎、内存扩展、Model-Specific Silicon、AI Fabric,每一个都可能长出独立的产品,甚至独立的公司。

第二,模型和芯片需要进入真正的协同设计。

传统上,都是先训完模型,再想办法部署到现成的芯片上。

但如果应用场景适合模型冻结一段时间,那么量化方案、MoE结构、Sliding Window Attention、MLA,甚至KV Cache的组织方式,都可以提前进入芯片设计阶段。

这么说来,模型就可能成为芯片设计的输入之一。

第三,评价一家AI芯片公司的方式要改了。

算力和显存的评价方式远远落伍了,以后更重要的问题应该是:"这颗芯片,在整个Token生产系统里负责哪一段?"

这是两种完全不同的产品思路,也对应着两种完全不同的公司。

J叔一贯喜欢做的,就是对未来有预见的事情。这并不是赌,而是深度分析之后的确定性。这一点,不论是对产品定义,还是对投资决策,都有重要的意义!

(本文作者姚金鑫-J叔为独角兽芯片公司产品与供应链负责人,CCF高性能计算专委会执行委员,如果希望进一步交流行业问题,可添加微信(Johnson_in_AI),请注明公司、职位)。本文不构成投资建议。)