来源:市场资讯
(来源:电脑报少年派)
近期,AMD收购了一家名为Taalas的AI芯片初创公司,其核心技术产品听起来简直像编的:在完全使用普通风冷、不需要任何高带宽内存(HBM)的前提下,它运行大模型的生成速度竟然达到了惊人的17000 Tokens/秒(相当于一秒钟蹦出上万个字)!
这种直接把大模型的所有权重数据“烧”死在了芯片的物理电路上的方式,真的能把AI的推理速度推向物理极限吗?
01
权重固化,能消除瓶颈吗?
计算和存储分离造成了冯·诺依曼瓶颈,这一点我们已经非常明确。数据在内存和CPU/GPU之间频繁跑来跑去,不仅拖慢了整体运行速度,还消耗了整个系统绝大部分的电量。
Taalas芯片的脑洞非常彻底:干脆不要内存了,直接把大模型的所有数据变成芯片上的物理电路线路。
它的原理本质上是将“软件数据”直接固化为“硬件电路”。在传统芯片架构中,大模型的权重是一堆保存在外部存储介质(如DRAM或HBM)中的二进制数据,计算时需要不断将数据读取到计算核心(ALU)中进行运算。
02
Taalas 芯片直接用物理走线替代大模型
而 Taalas 芯片在制造阶段(光刻掩膜板层面),就通过金属接触孔(Via)的有无,将大模型的权重参数直接作为物理结构嵌入到了芯片晶圆中。大模型的数据,就是芯片本身的物理结构。
这种设计彻底取消了传统计算中“寻址、读取、暂存”的数据搬运流程,将大模型推理转变为纯粹的电信号在特化物理网络中的传导过程,从而在物理层面上消除了延迟和传输功耗。
这其实也不是原创,它借鉴了20世纪八九十年代我们插卡玩的小霸王游戏机卡带技术(Mask ROM):通过芯片晶圆制造过程中的微小金属性接触孔的有无,有孔代表“1”,无孔代表“0”,直接在光刻掩膜板层面把数据刻印。
这意味着,在芯片被制造出来的这一刻,大模型的权重数据就已经像胎记一样,硬生生固定在芯片本尊身上了。
不过,这种极端的存算一体设计,优点是从根本上消除了数据搬运带来的开销,但背后的代价则是性能上的短板。
03
极速推理,数据精度受限
既然大模型已经长在芯片上了,当AI收到你的提问时,它根本不需要去内存里搬运数据。
但是数据写死了,怎么做AI所需的推理计算呢?如果传统的计算是“主观题”,每次都要现算,那Taalas的计算更像是“选择题”。
在芯片内部,每一个计算节点都有一个极其聪明的“乘法选择”电路。因为这里的权重数值已经是硬件物理固定的了,所以当你的提问(相当于一个激活值)传进来的时候,芯片内部不需要去查“权重是多少”,而是直接通过一个并行的电路,把所有可能的结果在同一瞬间全部算出来。
当电路确定当前需要调用哪个特定的权重数据时,就像开关一样直接连通对应结果的物理线路,最后由加法单元进行累加。
这种的做法带来了极具降维打击感的性能表现。在运行目前主流的80亿参数大模型时,它的吞吐速度直逼17000Tokens/秒 ;更恐怖的是,它的构建成本只有传统高性能推理芯片(如 Cerebras)的二十分之一,功耗仅为其十分之一,吹吹普通小风扇就能降温。
在模拟测试中,通过30颗芯片并联,DeepSeek这种大模型也能轻松跑出12000 Tokens/秒的速度!
然而,这并非完美无缺的解法。因为硬件电路表达的数值范围有限,它无法进行高精度计算。这就导致它应付简单的日常对话还可以,可一旦遇到复杂的写代码、数学计算或高难度推理,就会频繁犯错,有明显的“智商下降”感。
不过,Taalas 官方表示这只是早期的技术验证阶段,后续版本将提升数值精度,从而大幅修复准确率的短板。
04
应对迭代,留有后手
但肯定有人和我有一样的疑问:AI现在四个月左右就会迭代一次,今天好不容易把模型“烧”进了芯片里,明天模型更新了怎么办?
事实也很残酷,如果新版本模型出现,那么此前的这颗芯片确实就没有了任何利用价值,只能扔掉——对于研发费用高昂的芯片产业,把芯片做成“一次性耗材”,这听起来太过儿戏。
但细看其电路结构设计,就会发现Taalas其实考虑到了这一点,并且巧妙地留了“活口”。
在制造时,这颗芯片的大部分底层电路都是通用的“基础电路线路底座”,只有顶部的最后大约两层金属线路,是专门用来连接和调节硬编码大模型数据的。这意味着,如果大模型稍微变动,厂家不需要把芯片从头重新设计一遍,只需要修改顶部两层金属的走线,从拿到新模型到交付新芯片,全流程大约只需要两个月。
Taalas 芯片
考虑到了后期大模型迭代的问题
此外,芯片上并没有把所有生路完全堵死,它依然保留了一部分可读写的缓存内存(SRAM)。这部分内存不仅用来处理大模型生成时的常规临时数据(KV值),还可以用来加载类似大模型“动态外挂”的LoRA插件。企业可以在不改变硬件大模型底座的情况下,通过软件外挂进行小规模的功能微调,赋予了这颗“硬核耗材”一定的灵活性。
从长远来看,这颗芯片或许无法动摇英伟达通用GPU的统治地位,但在特定的“利基市场”(固定特定任务的成熟市场)或许有一定的替代价值。它的算力能让企业砍掉高昂的GPU算力租金,响应速度极佳,制造成本和功耗又很低,作为特定业务响应足矣。
热门跟贴