Meta 重回开放权重 AI 模型赛道——这一大型语言模型(LLM)细分领域由它开创,却曾因优先级错位而大体搁置。此次归来相当高调:刚发布的开放权重模型 Muse Glimmer 用了不少巧思,既确保模型能塞进单块消费级 GPU,又能以极快速度响应查询。
Meta 借助蒸馏使 Muse Glimmer 能装进单块消费级 GPU,并用一款微型伴生模型加快响应
Meta刚发布了Muse Glimmer,这是一款300亿参数的开放权重AI模型,意在与谷歌Gemma 4、阿里巴巴Qwen 3.6等同类产品竞争。
为方便不熟悉这一概念的读者:权重决定模型对任一概念应赋予多大重要性,也代表该模型知识库的全部广度。
Meta 的 Muse Glimmer 有两大突出之处。其一,若以全精度(fp16)运行 300 亿参数模型,仅模型权重就大约需要 60GB 内存(30×10⁹×2)。但 Meta 采用了量化——本质上是蒸馏:由更大的模型(Muse Spark)训练更小的模型,把自身许多能力灌输进去——从而把权重内存需求压到 20GB。再加上 KV cache 所需的 2GB 到 4GB,门槛已足够低,24GB 或 32GB 的消费级显卡就能轻松跑起 Muse Glimmer。据Meta称,经蒸馏做的模型压缩对性能没有可察觉影响。
其二,为加快 token 生成(也就是响应速度),Muse Glimmer 配有一款名为 DFlash drafter 的微型伴生模型,负责预测整段文本块;随后 Muse Glimmer 一次性校验答案,保留正确部分、丢弃错误部分。校验远快于从零生成,因此这一安排可显著提速:按Meta公布的数据,在RTX 5090上可快3.1倍,在M5 Max上1.8倍,在M4 Max上1.5倍。
当然,对西方开放权重 AI 模型格局来说,Muse Glimmer 的到来时机再合适不过。据 OpenRouter 数据,中国大语言模型的周 token 量近期首次突破 34.25 万亿,其中 DeepSeek 的 V4 Flash 周环比增长高达 570%。
根据 OpenRouter 最新数据集(对应自 8 月 3 日当周),全球 AI 模型用量达 69 万亿 token ,周环比上升 21.48% 。其中中国模型贡献 34.25 万亿,美国模型仅 9.17 万亿。关键在于:这已是中国模型连续第十五周领跑全球用量。
IDAS2026 IC设计自动化产业峰会
热门跟贴