近期,围绕大语言模型微调(fine-tuning)的关注度快速上升。LangSmith 团队发布了一份实操指南,介绍如何利用其平台完成数据集管理与评估,并分别基于开源模型和 OpenAI 的微调服务进行了验证。

微调热度来自两个变化

打开网易新闻 查看精彩图片

一方面,开源大模型生态在过去约一年里进步明显,从大幅落后于前沿水平,发展到接近前沿水平,部分模型已经可以在消费级笔记本上运行。另一方面,OpenAI 为 gpt-3.5-turbo 等较新模型开放了微调支持,改变了此前只有较旧模型可微调的局面。

这份指南把模型权重比作长期记忆,把提示词比作短期记忆。微调更像是考前一周集中复习,而把知识放进提示词里,则像开卷考试。因此,团队不建议用微调来教模型记住新的事实,因为微调可能增加幻觉;它更适合用来训练明确的专门任务。

用 LangSmith 跑通完整流程

指南以知识图谱三元组抽取作为测试任务,使用从 LangSmith 导出的训练数据,分别对 LLaMA2-7b-chat 和 gpt-3.5-turbo 进行微调,再用 LangSmith 对结果做评估。训练环节既覆盖了 CoLab 与 HuggingFace 上的开源模型路径,也覆盖了 OpenAI 的新微调服务。

团队还提到,在考虑微调之前,可以先评估提示词或检索增强生成(RAG)是否已经够用。对于有充足示例、且模型少样本学习能力不足的明确任务,微调会更合适。指南希望帮助使用者判断何时微调、如何微调,并借助 LangSmith 管理数据和评估效果。