打开网易新闻 查看精彩图片

聊起大模型,很多人第一反应是:

  • 要么得付费订阅,要么参数动辄几百亿、几千亿,得堆服务器才跑得动,跟自家电脑没关系。
  • 但8月11日,蚂蚁百灵做了一件挺实在的事——把一款叫 Ling-3.0-tiny 的轻量级模型直接开源了。
  • 它的厉害之处不是"大",而是"小到能装进你的 MacBook,还不用花一分云钱"。

先看硬数字

打开网易新闻 查看精彩图片

Ling-3.0-tiny 总参数 7.9B,但每次推理只激活 1.3B 参数——这个"激活量"才是真正吃算力的部分。

  • 换句话说,它把绝大部分参数"休眠",只唤醒跟当前问题相关的那一小撮,既保住脑子,又压住功耗。
  • 官方同时放出 BF16、FP8、INT4 三个精度版本,适配不同设备,已经在英伟达 DGX Spark、Apple Silicon 的 MacBook 和 Mac mini 上跑通验证。

速度上也有底气

  • 在 FP8 精度下,M4 Pro 的 MacBook 上推理速度约 86–90 tokens/s;
  • 8K 上下文长度时,峰值内存占用仅 8.34GiB。
  • 这意味着一台普通的苹果笔记本,就能流畅跑起能聊天、能推理的本地模型。

更关键的是"分数"

  • 在 Artificial Analysis 的 Intelligence Index 评测里,Ling-3.0-tiny 拿到 25 分,只比 Gemma-4-26B-A4B 低 1 分,却高于 gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B 等一众更大体量的模型;
  • 在智能体(Agentic)榜单上,它的得分甚至超过了 31B 级别的模型。1.3B 的"实战激活量"打出了远超自身体量的成绩——这也是"小模型硬刚大模型"说法的由来。

架构上它站在两家开源成果的肩膀上

打开网易新闻 查看精彩图片

月之暗面自研的 KDA(Kimi 增量注意力)和 DeepSeek 自研的 MLA(多头潜在注意力)按 3:1 交替堆叠,再配上 128 个路由专家的稀疏 MoE 结构。

每个 token 只激活 8 个路由专家加 1 个共享专家,在长上下文、参数效率和成本之间找平衡。它原生支持混合推理——通过 enable_thinking 参数,可以一句话开或关"思考模式",要快答就快答,要深想就深想。

它对普通人的价值

打开网易新闻 查看精彩图片

集中在一个 Demo 上:

  • 有人在 36GB 内存的 MacBook Pro 上复刻了"无限百科"——读文章时点一下生词,本地模型立刻蹦出解释卡片,还能层层往深挖。
  • 全程本地推理、不调云端,首 token 响应低于 100 毫秒,所有数据留在设备里,不产生任何云端 API 计费。
  • 对在意隐私、又不想每月给云厂商交"模型税"的人,这等于把一座知识引擎搬回了自家书桌。

普通人怎么用上?

  • 最直接的路径:去 HuggingFace 把权重拉下来,按官方指引在 Apple Silicon Mac 或 DGX Spark 这类设备上部署即可,INT4 版本对硬件更友好。
  • 这里要把预期说清楚:它能本地跑,前提是你的设备得有一定配置(比如较新的苹果芯片 Mac 或带专用算力的开发机),不是随便一台老笔记本点开就能满速;
  • 它省的是"云端调用费",硬件本身还是要的。别被"7.9B 总参数"唬住,也别以为零门槛——按需部署就好。

为什么这事值得普通用户关注?

过去"在自己电脑上跑能打的模型"像是极客专利,如今蚂蚁把权重、代码、多精度版本一股脑开源,等于把门槛又削低了一截。

  • 对普通人,意义未必是"我要去部署它",而是多了一个数据不出门、不按月交费的国产选择;
  • 对开发者,则能用这个底座搭自己的本地智能体、私有知识库,而不必把公司文档一股脑塞进公有云。
  • 从行业看,国产开源正从"放权重"走向"给完整可跑方案"。比起又一轮云端参数军备竞赛,把能落地的本地模型交到用户手里,对普通人显然更实在。这也是值得每个关心 AI 的人去试一试的新物种。

原创内容。如果你觉得有帮助,欢迎关注「AI工具跃迁」,每天发现一片AI新大陆~

#AI工具# #蚂蚁# #开源#