大模型学新知识就忘旧知识,这个老大难问题有了新解法。一个名为CellularFlow的开源项目,提出把知识存储和序列推理彻底解耦,在持续学习场景下实现了83.9%的知识保留率

这个数字意味着什么?传统微调方式下,模型学习新任务后,旧任务表现往往断崖式下跌,有时甚至跌到20%以下。CellularFlow的思路是:既然遗忘的根源在于参数共享,那干脆别让记忆和推理挤在一起。

打开网易新闻 查看精彩图片

记忆和推理,各干各的

架构上,CellularFlow引入了两个独立模块:联想式DNA记忆库负责长期知识存储,情景缓冲区处理短期上下文。推理时,模型先从记忆库中检索相关知识,再结合当前输入进行序列推理。

这种设计借鉴了生物记忆机制——DNA存储遗传信息,情景记忆处理近期事件,两者互不干扰。放到模型里,就是知识写入和推理计算不再共享同一组参数,从根源上避免了灾难性遗忘。

开源项目,效果可复现

项目已在GitHub上开源,代码和实验配置均可直接获取。对于正在做持续学习、增量训练或者模型终身学习方向的开发者,这个架构提供了一个值得对照的基线方案。

83.9%的保留率当然不是终点,但它至少证明了一件事:对抗遗忘,不一定非要靠回放旧数据或者正则化约束,把存储和推理物理隔离,也是一条走得通的路。