一个关键变化正在发生:本地运行的AI模型,已经能在绝大多数日常对话和推理任务中,交出和云端前沿模型几乎一样好的答卷。

斯坦福大学与Together AI在2025年11月发布的一项研究显示,本地AI模型在89%的日常聊天与推理查询中,表现与前沿云端模型相当。这一结论建立在超过100万条真实查询20多个本地模型的测试之上,结果具有广泛代表性。

打开网易新闻 查看精彩图片

这意味着什么?简单说,我们正在用同样的电力,产出更多的智能。每瓦特电能带来的智能产出正在提升,同样的电子数量,完成了更多工作。

智能效率:从库米定律到“每瓦特智能”

追踪计算效率的变化并不是新鲜事。库米定律(Koomey's Law)曾指出,每瓦特计算能力大约每1.5年翻一番,这一趋势持续了数十年,把曾经占据整个房间的大型主机,压缩进了今天的笔记本电脑机身。

如今,同样的逻辑正在AI领域重演。研究人员提出,正如当年“每瓦特性能”引导了从大型主机到个人电脑的转变,“每瓦特智能”将引导AI向边缘设备迁移。

不过,GPU的效率提升曲线比当年的CPU要平缓一些。过去15年,GPU的计算效率大约每2.7年才翻一番,而非库米定律所说的1.5年。但即便如此,进步依然可观。

本地模型追赶速度惊人:胜率三年翻三倍

更直观的变化体现在模型能力的对比上。研究数据显示,最好的本地模型对阵前沿模型的胜率或打平率,从2023年的23.2%,上升到2025年的71.3%,平均每年提升约20个百分点。

到了2026年,如果由一个本地AI来为任务挑选合适的另一个本地模型,这个数字可以接近90%

效率提升也在同步发生。同一时期,“每瓦特智能”提升了5.3倍,其中3.1倍来自模型本身的改进,1.7倍来自芯片硬件的进步。计算机更快了,模型更聪明了,最终受益的是终端用户。

云端仍然不可替代,但场景正在分化

当然,这并不意味着云端AI会被淘汰。研究明确指出,在以下场景中,云端依然不可或缺:

  • 需要多步骤推理的复杂任务
  • 难度最高的专业技术领域
  • 依赖大规模并行计算的工作负载

云端硬件在许多使用场景中仍然保有优势。数据显示,云端推理相比本地模型,能带来40%的能效提升。数据中心可以批量处理查询请求,这是目前一次只服务一个用户的本地硬件还做不到的。

但对于大部分日常知识工作来说,根本没有必要把查询发送到数据中心。本地模型加上一个路由选择器,已经足以应对绝大多数工作场景。

省电80%,省钱74%:本地化的现实收益

把任务留在本地,带来的收益是实实在在的。研究数据显示,相比完全依赖云端的方案,本地模型加路由的组合可以:

  • 削减80%的能源消耗
  • 减少77%的计算量
  • 降低74%的成本

这些数字背后,是一个正在成形的趋势判断:大型主机变成了个人电脑,数据中心也将走向个人化

当你的手机或笔记本电脑上的模型,已经能处理近九成的日常AI需求,把每一次查询都送到千里之外的数据中心,可能就不再是唯一的选择了。