“过去在本地跑AI,要么得上块好显卡,要么就得忍着慢吞吞的生成速度和不怎么样的回答。”这是我一直以来的真实感受。很长一段时间里,本地运行大语言模型就是硬件党或者极客的专属爱好,普通人的笔记本或者手机连跑个演示版都卡得难受。但最近一年多,情况发生了明显变化。几大巨头推出的小尺寸模型,开始专门瞄准了普通人手头已有的设备,不用服务器机架,也不用24GB显存,就能在本地跑得起来。

在很多人眼里,这些参数不到40亿的小模型基本就是“玩具”——聊聊天可以,真干活就露馅。我起初也抱着这种想法,但实际测下来,却发现事情没那么简单。我的硬件属于“够用就行”那档,没有发烧级配置,这反而逼着我只能去挑那些真正为普通硬件优化的模型,而不是看纸面规格吹得天花乱坠的那种。过去几个月,我几乎把所有能找到的值得一试的40亿参数以下的本地模型都跑了一遍。大部分的确只是“演示级”,装完、点开、试几句、删掉。但有那么几款却留在了我的设备上,变成了日常工具箱的一部分。谷歌的Gemma 4 E2B就是其中之一。

打开网易新闻 查看精彩图片

Gemma 4 E2B是谷歌在2026年3月底发布的Gemma 4系列里最小号的一个变体。名字里的“E”代表的是“有效参数”(effective parameters),这里藏着一个巧妙的设计:逐层嵌入(Per‑Layer Embeddings)。简单说,它不是让整个模型去跑一套统一的巨大参数表,而是给每个解码器层都配上了自己独立的小型嵌入表,每次查询更像是翻阅一本手册,并不需要跑完整的巨量计算。这样一来,模型实际储存的参数量是超过标签上那个“2B”的,但真正活跃的计算负载却依然维持在20亿参数模型的水平上,这也是它能在有限硬件上跑得如此顺滑的主要原因。

另一个让长上下文不爆炸的关键,是它用了一种混合注意力机制。普通的全局注意力在输入长度翻倍时,内存占用会按平方级别往上飙,而Gemma 4 E2B把局部滑动窗口注意力和全局注意力交叉着用,这就把长文本推理时的内存消耗给压住了。因此,虽然标称上下文窗口高达128K,但实际跑起来并不像很多大模型那样吃显存和内存。

更让人意外的是这个小东西的功能完整度。Gemma 4 E2B原生支持文本、图像和音频三种模态的输入,涵盖超过140种语言,并且支持函数调用功能。基本上大模型上才有的那些特性,都被塞进了这个20亿参数的小身板里。它甚至允许在支持的推理框架里直接传入音频,只不过目前多数主流的本地运行器还没有打开这道门。

要说最让我决定把它留在手机和Chromebook上日常使用的原因,其实是它的“个性”。和很多小模型生硬、机械的对话风格不同,Gemma