打开网易新闻 查看精彩图片

周二,IBM正式发布了其开放权重Granite大语言模型的最新系列。新系列提供30亿、80亿和300亿三种参数规模,与业内部分竞争对手相比,IBM采取了截然不同的模型构建路线——从头预训练的纯密集解码器推理模型。

近期,包括英伟达Nemotron 3系列在内的多款模型,已逐渐从全注意力Transformer架构转向Mamba与注意力机制结合的混合架构。IBM在Granite 4.0系列中也曾尝试过这一方向,那一代同时提供了传统密集、密集混合以及混合MoE三种模型形态。

到了Granite 4.1阶段,IBM将主线系列重新回归全注意力密集Transformer架构,并表示新模型不仅性能优于上一代,"还采用了更简洁——因而更灵活——的架构,便于针对下游任务进行微调"。

IBM将Granite 4.2系列定位为"以推理为核心的版本更新"。模型支持思维模式与非思维模式两种运行状态,并新增了低消耗模式——在回答简单问题时仅调用较少的推理Token。

在发布Granite 4.1时,IBM曾认为推理模型的效率尚不足够,"对于指令跟随、工具调用等特定企业任务,转向成本更低、基准表现相近的非推理模型更为合理"。而此次4.2系列的发布表明,IBM团队已明确认定推理能力是必要功能——尽管在4.2系列中这一功能仍作为可选项保留。

不过,与同级别的其他模型相比,如Qwen-3.8 27B、Muse Glimmer 30B以及谷歌的Gemma 4 31B,Granite 4.2目前仍为纯文本模型,而上述三款均已支持多模态。值得注意的是,IBM此前已推出Granite Vision 4.1 4B视觉模型,未来不排除推出4.2视觉版本的可能性。

此外,IBM此次同步发布了Granite Speech系列中的两款全新语音识别模型。

本次发布的模型采用Apache 2.0开源协议,在15万亿Token的数据集上分五个阶段完成预训练,其中包含一个长上下文训练阶段,使该系列上下文窗口扩展至51.2万Token(但对外发布的配置原生支持12.8万Token)。

IBM还透露,训练数据集中包含1万亿Token的合成代码,由IBM自研的CodeAlchemy流水线生成,不过模型整体的代码生成能力目前仍属中等水平。

三款模型总体上共享相同的训练流程,但80亿和300亿参数模型额外经过了面向智能体的强化学习步骤,使其具备工具调用、代码编辑与运行、终端操作以及网页搜索等能力。IBM表示:"结合基于人类反馈的强化学习对齐方法,这一方案使模型在复杂多步骤的智能体任务中表现更为出色。"30亿参数模型同样支持工具调用,但整体能力相对有限。

从基准测试成绩来看,Granite 4.2系列并未刷新行业纪录,但值得关注的是,80亿参数的小模型在多项测试中的表现已与300亿参数的大模型十分接近——且该模型几乎可在任何现代Mac设备以及部分中低端英伟达RTX显卡上流畅运行。在横向对比中,Qwen 3.8 27B在多项指标上全面领先Granite系列,尤其在代码任务上差距明显,IBM模型在该领域的表现整体欠佳且不够稳定。

当然,基准测试只能反映模型能力的一部分。对于适合的使用场景而言,顶尖前沿模型往往过于庞大,IBM认为Granite系列的核心竞争优势在于高吞吐量智能体任务中的实际表现。

IBM在发布公告中写道:"本次发布进一步丰富了Granite系列,目标明确:帮助企业构建能够在真实工作流中进行推理、执行操作并动态适应的智能体。如今AI系统被要求在现实世界中完成实际任务,我们的期望也随之提高。仅做到回答清晰简洁已远远不够。一个AI系统必须具备规划能力、能够调用应用程序并可靠稳定地完成复杂任务——同时保持足够轻量,真正做到经济可用。"

Q&A

Q1:IBM Granite 4.2系列有哪些参数规模,分别适合什么场景?

A:Granite 4.2系列提供30亿、80亿和300亿三种参数规模。其中80亿参数模型在基准测试中表现接近300亿参数模型,且可在现代Mac或中低端英伟达RTX显卡上运行,适合资源有限的部署场景。30亿参数模型支持工具调用但能力有限,适合轻量任务。300亿参数模型则适用于对性能要求更高的企业级智能体工作流

Q2:Granite 4.2的推理模式有哪几种?各有什么特点?

A:Granite 4.2支持三种运行模式:思维模式(开启推理)、非思维模式(关闭推理)以及低消耗模式。低消耗模式是新增功能,在回答简单问题时只使用少量推理Token,可在保证效率的前提下降低计算成本,对企业用户较为友好。

Q3:Granite 4.2和Qwen 3.8 27B相比,哪款模型更强?

A:从基准测试来看,Qwen 3.8 27B在多项指标上全面领先Granite 4.2系列,尤其在代码任务方面差距明显。但IBM认为Granite的优势在于高吞吐量智能体任务场景,且模型轻量、部署成本低,更适合有实际落地需求的企业用户,两者的适用场景和侧重点有所不同。