我们可以通过精心构造的提问,从Claude、GPT这类前沿模型中“拷问”出一些关于它们训练过程的隐藏信息。虽然这些估计并不精确,但能帮助我们大致了解模型背后的数据配方、参数规模,甚至训练时间线。 前沿大模型的训练大致分为三个阶段:先用海量互联网数据做“预训练”,得到一个强大的续写模型;再用教科书级别的领域数据提升基础能力;最后通过指令微调把它变成会聊天、会推理、会调用工具的助手。其中成本最高、耗时最长的是预训练阶段,往往需要数月时间,产出一个巨大的基础检查点文件。 如何探测这些秘密?文章提到几种方法:用“不可压缩知识探针”测试模型对冷门事实的掌握程度,从而估计参数量;用“数据混合推断”观察分词器对内容的拆解方式,来反推预训练数据集的构成;另外,通过询问模型的自我认知日期或特定时间相关的问题,可以估计它的知识截止日期和训练时间线。 作者强调,这些方法都只是估算,因为公开可验证的真实信息很少,部分推测可能完全不正确。但即便如此,这些探针依然是我们观察大模型训练过程的一扇小窗。
打开网易新闻 查看精彩图片
热门跟贴