模型家族与训练基础

Granite 4.2推出一个稠密、仅解码器的推理大语言模型系列,包含3B、8B和30B三种规模。这些模型从零开始构建,训练数据总量达到15万亿个token。

打开网易新闻 查看精彩图片

五阶段预训练流程

训练过程分为五个阶段的预训练,随后进行监督微调。整个流程没有依赖已有模型权重,而是从零开始完成参数学习。

多阶段强化学习与工具使用

在监督微调之后,模型还经过多阶段强化学习管线。其中包含面向工具使用的智能体强化学习环节,用于提升模型在调用工具场景下的表现。