一个关键变化正在发生:本地运行的AI模型,已经能在绝大多数日常对话和推理任务中,交出和云端前沿模型几乎一样好的答卷。
斯坦福大学与Together AI在2025年11月发布的一项研究显示,本地AI模型在89%的日常聊天与推理查询中,表现与前沿云端模型相当。这一结论建立在超过100万条真实查询和20多个本地模型的测试之上,结果具有广泛代表性。
这意味着什么?简单说,我们正在用同样的电力,产出更多的智能。每瓦特电能带来的智能产出正在提升,同样的电子数量,完成了更多工作。
智能效率:从库米定律到“每瓦特智能”
追踪计算效率的变化并不是新鲜事。库米定律(Koomey's Law)曾指出,每瓦特计算能力大约每1.5年翻一番,这一趋势持续了数十年,把曾经占据整个房间的大型主机,压缩进了今天的笔记本电脑机身。
如今,同样的逻辑正在AI领域重演。研究人员提出,正如当年“每瓦特性能”引导了从大型主机到个人电脑的转变,“每瓦特智能”将引导AI向边缘设备迁移。
不过,GPU的效率提升曲线比当年的CPU要平缓一些。过去15年,GPU的计算效率大约每2.7年才翻一番,而非库米定律所说的1.5年。但即便如此,进步依然可观。
本地模型追赶速度惊人:胜率三年翻三倍
更直观的变化体现在模型能力的对比上。研究数据显示,最好的本地模型对阵前沿模型的胜率或打平率,从2023年的23.2%,上升到2025年的71.3%,平均每年提升约20个百分点。
到了2026年,如果由一个本地AI来为任务挑选合适的另一个本地模型,这个数字可以接近90%。
效率提升也在同步发生。同一时期,“每瓦特智能”提升了5.3倍,其中3.1倍来自模型本身的改进,1.7倍来自芯片硬件的进步。计算机更快了,模型更聪明了,最终受益的是终端用户。
云端仍然不可替代,但场景正在分化
当然,这并不意味着云端AI会被淘汰。研究明确指出,在以下场景中,云端依然不可或缺:
- 需要多步骤推理的复杂任务
- 难度最高的专业技术领域
- 依赖大规模并行计算的工作负载
云端硬件在许多使用场景中仍然保有优势。数据显示,云端推理相比本地模型,能带来40%的能效提升。数据中心可以批量处理查询请求,这是目前一次只服务一个用户的本地硬件还做不到的。
但对于大部分日常知识工作来说,根本没有必要把查询发送到数据中心。本地模型加上一个路由选择器,已经足以应对绝大多数工作场景。
省电80%,省钱74%:本地化的现实收益
把任务留在本地,带来的收益是实实在在的。研究数据显示,相比完全依赖云端的方案,本地模型加路由的组合可以:
- 削减80%的能源消耗
- 减少77%的计算量
- 降低74%的成本
这些数字背后,是一个正在成形的趋势判断:大型主机变成了个人电脑,数据中心也将走向个人化。
当你的手机或笔记本电脑上的模型,已经能处理近九成的日常AI需求,把每一次查询都送到千里之外的数据中心,可能就不再是唯一的选择了。
热门跟贴