一个被重新计算的设想

有人提出一种方案:把AI推理节点分散到普通家庭里,而不是集中建更大的数据中心。这个设想被命名为HEARTH。它不追求拼成一台巨型计算机,而是让数百万个独立推理节点各自运行。

每个家庭的车库墙上可以装一台算力设备,功耗大约5千瓦,和电动车充电桩相当,但运行时间更长。设备里常驻一个小型AI模型,冬天废热可以供暖,夏天则需要排热。家庭不用购买设备,反而因为托管它获得报酬。

这些节点分布在社区、州乃至数百万家庭中。新请求会自动绕开离线的家庭。网络扩张靠的是接入已经建成并连上电网的房屋,而不是新建机房

三次概念形态暴露真正问题

为了让设备不那么抽象,设计者提出了三种概念形态:壁挂式单元、落地式热塔,以及集成到设备间的风管式单元。它们只是外观和安装研究,不是工程产品,目的是暴露真实原型必须回答的问题。

随后,模型开始不断改变答案。最初对比聚焦在数据中心的建设成本上,把两边的计算硬件视为相同。但相同硬件并不会从经济账里消失。如果一个地点的昂贵GPU利用率更高,利用率差距可能抵消建筑成本省下的所有钱。

模型被重建了五次,每次加入前一次遗漏的约束。第五次没有拯救原始方案,而是替换了它。

幸存下来的只有小型独立推理

住宅算力网络并不是运行所有AI负载的更便宜场所。它无法跨互联网汇集内存,无法训练前沿模型,也无法消除住宅延迟。最终能成立的范围更窄:小型模型推理,一个节点完成一个请求,不把持久状态绑定在特定家庭上。

模型尺寸改变经济性,是因为推理不只是GPU之间的竞赛。生成过程中,服务器会反复读取模型权重,同时推进多个请求,这就是批处理。更大的批次可以把每次权重读取分摊到更多付费token上,但每个活跃请求也会占用工作内存,通常称为KV缓存。

一个约80亿参数的模型,在32GB消费级GPU上还能留下足够内存支撑可用的生产批次。在这个模型里,家用GPU和数据中心硬件随后都主要受计算限制,消费级部件的优势因此得以保留。

更宽而非更大的算力网络

这个网络目前并不存在。几乎所有物理部件都不稀奇,真正要验证的是它们能否被编排和调度成一个系统。不是一台更大的计算机,而是一台更宽的计算机。