华为开源盘古openPangu-2.0的预训练、SFT代码和后训练RL代码正式开源上线。openPangu-2.0模型相关组件已陆续上线开源平台。
这次放出的不是单一权重文件,而是三段关键代码:预训练、SFT(监督微调)、后训练RL(强化学习)。对想复现或二次开发大模型的团队来说,这三段基本覆盖了从底座到对齐的主要环节。
打开网易新闻 查看精彩图片
三段代码分别管什么
打开网易新闻 查看精彩图片
预训练代码对应模型从零开始学习语言规律的过程;SFT代码负责把底座模型调成能听懂指令的形态;后训练RL代码则用于进一步对齐人类偏好。三者串起来,是一条完整的训练链路。
华为选择把这条链路整体开源,而不是只放推理接口或部分权重。相关组件已陆续上线开源平台,意味着开发者可以按需取用,而不是等一个打包好的黑盒。
开源节奏在加快
打开网易新闻 查看精彩图片
从权重到代码,大模型开源的门槛正在被一层层拆掉。预训练代码因为涉及数据配比和并行策略,过去往往是各家最不愿公开的部分。这次一并放出,对社区来说省去了大量试错成本。
openPangu-2.0的组件还在陆续上线,后续会有哪些模块跟进,值得继续盯。
热门跟贴