周二,IBM正式推出旗下开源权重Granite大语言模型的最新家族。新系列覆盖30亿、80亿和300亿参数三个规模,全部采用密集解码器架构,并从零开始完成预训练。与近期多家厂商转向混合Mamba/注意力架构的做法不同,IBM这次选择了一条更简洁的路线。

架构回归全注意力Transformer

打开网易新闻 查看精彩图片

此前IBM曾在Granite 4.0一代尝试过多种架构,包括传统密集模型、密集混合模型以及混合专家模型。到了Granite 4.1,IBM把主力家族重新拉回全注意力、密集Transformer架构。当时IBM给出的解释是,新一代模型在性能上超过旧代,同时“使用更简单、因而更灵活的架构,便于下游任务微调”。

这一判断在4.2版本中得到延续。IBM将Granite 4.2定位为“以推理为重点的版本”。模型可以在思考模式和非思考模式下运行,还额外提供一种低努力模式,只消耗少量推理token来回答简单问题。值得注意的是,在发布Granite 4.1时,IBM仍认为推理模型效率不足,企业用户在指令遵循和工具调用等特定任务上,选择成本更低、基准表现相近的非推理模型更合理。如今团队显然改变了看法,认为推理能力已经成为必要功能,即便在4.2系列中它仍然是一个可选项。

纯文本路线与同代差异

与同级别的一些模型相比,Granite 4.2走的是纯文本路线。像Qwen-3.8 27B、Muse Glimmer 30B以及Google的Gemma 4 31B都具备多模态能力,而Granite 4.2只处理文本。IBM并非完全没有视觉模型,例如此前已经提供Granite Vision 4.1 4B,未来是否会有对应的4.2版本目前还没有明确消息。同一天,IBM还在Granite Speech家族中发布了两款新的语音识别模型。

预训练与工具调用能力

这批采用Apache 2.0许可的模型在15万亿token上完成预训练,整个过程分为五个阶段,其中包括长上下文训练阶段。这一阶段把家族的上下文窗口提升到512,000 token,不过发布配置原生支持的是128K。IBM还提到,训练集中包含1万亿token的合成代码,由IBM的CodeAlchemy流水线生成,但模型整体的编码表现仍处于平均水平。

大部分模型共享同一条训练流水线,而80亿和300亿参数版本额外经过了一步智能体强化学习,使它们能够调用工具、编辑和运行代码、在终端中工作以及搜索网页。IBM表示,结合基于人类反馈的强化学习对齐,这一方法旨在让模型在真实任务中具备更强的执行能力。