文 | 象先志 Meta最近的境遇,堪称冰火两重天。 一边是四个州总检察长联手,把索赔数字喊到了1.4万亿美元——几乎等于Meta目前1.48万亿的总市值,指控它故意将Facebook和Instagram设计成让青少年上瘾的产品。另一边,Meta Superintelligence Labs却在8月10日悄然开源了Muse Glimmer:一个30B参数的Agent模型,直接挂上了最宽松的Apache 2.0许可证。 这是Muse系列第一次开源。此前这条产品线一直闭源,只走API通道。 先把公开资料能确认的规格摆上桌。 Muse Glimmer由Meta Superintelligence Labs训练——就是Scale AI创始人Alexandr Wang带队的那家实验室。官方定位很明确:不做聊天机器人,做常驻本地的Agent(always-on local agent)。 架构上,它是一个30B的稠密多模态模型:27.9B的文本解码器,配一个1.9B的ViT视觉编码器和GELU投影层。文本部分共52层Transformer,采用分组查询注意力(32个Q头对2个KV头),外加混合滑动窗口机制——每三层为2048窗口的局部注意力,夹一层全序列注意力,局部层用RoPE、全局层用NoPE,借此把上下文窗口撑到128k以上。 许可证是Apache 2.0:商用、修改、再分发,基本不设门槛。权重已在Hugging Face开放,GGUF和Unsloth变体同步放出。 落地速度快得反常:发布当天,llama.cpp、Hugging Face Transformers、Ollama 0.32.7、LM Studio、SGLang全部实现day-0支持,MLX、vLLM随后几天跟进,AMD、Arm、Intel、NVIDIA都参与了设备端优化。Meta这次明显是有备而来。 30B怎么塞进24GB显卡?30B模型全精度需要55GB以上内存,RTX 5090都装不下。Meta用了两板斧。 第一板斧是量化。权重压到约4-bit,语言模型本体缩到20GB以内,省出来的显存留给KV cache、视觉编码器和投机解码的小模型,整体落在24GB或32GB的包络里。官方说法是,压缩对Agent任务的性能几乎无损。 第二板斧是投机解码,值得拆开讲。传统解码是一个词一个词往外蹦,每一步都要把30B参数完整过一遍。Glimmer配了一个基于DFlash的轻量drafter,数据流是这样的: 小模型先“猜测”一大段,主模型一次前向就把整段验证完——猜对的白赚,猜错的改掉。生成质量不变,速度直接翻倍起步。实测数字:RTX 5090上解码从74.9 tok/s拉到233 tok/s,提速3.1倍;M5 Max的MacBook提速1.8倍到50 tok/s,M4 Max提速1.5倍。SGLang那边更激进,RTX 5090上NVFP4加DFlash,单用户236 tok/s,批量吞吐冲到1452 tok/s。 说白了,Meta用工程手段把一个60GB级的模型,压进了24GB级设备,还跑得足够快——本地Agent最怕的就是想很久才蹦一句话,这个问题算是正面解决了。 能力从哪来?答案藏在自家闭源旗舰里。 Glimmer的训练分三段:预训练阶段用Muse Spark的输出做logit蒸馏;中训阶段加长上下文、塞入更密集的Agent数据;后训练结合监督微调、on-policy蒸馏和强化学习。 所谓logit蒸馏,通俗讲就是:老师模型(Muse Spark)不只要告诉学生“答案是什么”,连“每个候选词的概率分布”都手把手教过去。复杂推理链路和Agent交互数据,全部由这个庞然大物生成,再灌进30B的小身板。 这套流程砸出来的能力清单很“Agent向”:精确schema的工具调用、多步推理、工具调用失败后自己诊断报错并重试、读截图和图表的多模态输入、100多种语言,还兼容OpenClaw这类编排框架。 不过这里得泼点冷水。官方对比里,Glimmer在MCP Atlas上拿到75.5分,压过Gemma4-31B的54.2和Qwen3.6-27B的62.5;但在OSWorld-Verified、TerminalBench 2.1和SWE-Bench Verified上,反超的恰恰是Qwen3.6-27B。也就是说,这个“小钢炮”在工具调用链路上很强,真到电脑操作和终端写代码的硬碰硬,同尺寸的国产模型还站在它前面。 时间点选得很微妙,三条线拧在一起。 第一条线是开源生态的攻守易形。扎克伯格同日发了一封14页的长文《The Future is for Everyone》,给Meta的AI路线定调:超级智能应该交到每个人手里。在诉讼金额几乎打平市值的当口,开源一款定位本地Agent的模型,既是技术宣言,也是某种姿态——你指控我夺走青少年注意力,我偏把最前沿的能力拆开送给所有人。
热门跟贴