打开网易新闻 查看精彩图片

这项由北京人工智能研究院(BAAI)、北京热力集团有限责任公司(BDHG)与北京邮电大学(BUPT)联合开展的研究,于2026年8月发表在arXiv预印本平台,编号为arXiv:2608.01862v1。感兴趣的读者可以通过该编号查阅完整论文。

**研究背景:当通用AI遇上企业内部的"秘密档案室"**

每家企业都有一座"秘密档案室"——里面装满了内部操作规程、技术标准、管理政策,以及各类专有知识文件。这些内容从未出现在公开的互联网上,因此那些用海量公开数据训练出来的通用AI助手,对这些内容一无所知。当员工向AI提问"我们公司供热系统的紧急停机操作规程是什么"时,再聪明的通用AI也只能摇头说不知道。

这个问题并不小众。几乎所有拥有内部知识体系的企业,都面临同样的困境:如何让AI真正掌握企业的"私房知识",同时又不变成一个只懂本行业、其他什么都不会的偏科选手?

北京人工智能研究院的研究团队为此开发了一套名为"Wnuan"(暖暖)的系统,并设计了一套分三步走的训练方案。这套方案在707道企业知识问答题上进行了测试,结果显示,模型给出可接受答案的比率从训练前的52.76%一路攀升到91.51%,超过了所有被纳入对比的市面顶级商业AI接口。

**一、什么叫"可接受答案率",为什么它是衡量标准**

在正式介绍这三步方案之前,有必要先解释一个贯穿全文的核心指标——"可接受答案率"(AAR)。

企业知识问答的答案往往很复杂,不像考数学题那样非对即错。一道关于操作规程的题目,AI可能答出了80%的要点,却遗漏了一个关键条件;也可能答出的内容完全正确,但不够完整。为了处理这种"半对不对"的情况,研究团队将模型的回答划分为三类:完全正确、部分正确、完全错误。"可接受答案率"把前两类合并计算,统计模型给出至少部分正确答案的比例。

这个指标之所以重要,是因为在实际企业应用中,一个能给出正确方向、需要人工补充细节的答案,远比一个完全答错或拒绝回答要有价值得多。整个研究都以这个指标为核心评判依据。

**二、第一步:把企业文件变成"可学习的练习题"**

炼金的第一步,是把那座"秘密档案室"里的文件,变成AI能从中学习的素材。

原始企业文件大多是Word文档或PDF,里面全是大段大段的说明文字,就像教科书一样枯燥。AI如果直接去"读"这些文件,效果往往不好——就像你让一个人死背整本教材,却从不做练习题,考试时往往发挥失常。

研究团队采取的策略是:把文件转化为"一问一答"的练习题。具体来说,系统会先把文件切分成一段段有意义的片段,然后针对每个片段自动生成问题。这些问题被设计成六种类型,涵盖事实提取、机制解释、设计原理、条件约束、局限性分析和对比分析,覆盖了企业实际提问的主要场景。

生成的问题必须满足几个硬性条件:问题本身要能独立成立,不能含有"如上所述"这样依赖上下文的表达;问题必须有明确可查的答案;问题的表述必须清晰、可理解。经过一系列质量筛查之后,系统最终得到了221,294组问答对。

但研究团队没有就此停步。他们还做了一个额外的精细化处理:用目标模型(Qwen3-32B)重新改写答案,使答案的表达风格更贴近模型自身的生成习惯。这个步骤叫做"目标对齐答案重写"。在221,294组数据中,有164,744组的答案经过了这道重写工序,其余56,550组则保留了原始答案。筛选标准是改写后的答案与原始答案在语义上的相似度必须达到0.8以上,否则就放弃改写、保留原版。

这道工序有点像请一位擅长演讲的人,把专业报告改写成适合现场宣讲的版本——内容不变,但表达方式更符合听众(也就是模型本身)的接受习惯。实验结果显示,这道工序本身并没有直接提升企业问答的准确率,但它有效恢复了通用能力的表现,让模型在学会企业知识的同时,不至于在通用场景下变得结巴。

这一阶段的对比实验显示,与直接用固定窗口切片来训练的方式相比,采用"文档转问答题"的方式,可接受答案率提升了31.12个百分点,同时只多消耗了约27.8%的计算量。

**三、第二步:在学习企业知识的同时,不忘"保持通才"**

进入第二步,研究团队面临一个经典的AI训练难题,用一句话来说就是"学了新东西,忘了旧知识"。

把所有221,294组企业问答题喂给模型,它确实会变成企业知识的专家。但代价是,它可能开始忘记怎么写通顺的句子、怎么按照指令格式回答问题。这种现象在AI训练领域有个术语叫"灾难性遗忘",听起来有点夸张,但现实中确实会发生。

为了对抗这种遗忘,研究团队在企业问答训练数据里,混入了一定比例的通用知识练习题。这就像一个正在专攻医学的学生,每周仍然抽时间读一读文学、做一做数学题,以防自己变成一个除了医学什么都不懂的书呆子。

研究团队系统地测试了五种混合比例:完全不混(0%)、混入5%、25%、50%、100%的通用数据。评判标准是综合三项通用能力测试(MMLU、IFEval、C-Eval)的平均得分。

结果显示,混入约48.3%通用数据的方案表现最佳,在保持企业问答能力的同时,通用能力也保持得最好。与完全不混通用数据相比,这个方案损失了不到2个百分点的企业问答准确率,却换来了通用能力平均提升2.49个百分点。这个经过SFT(监督微调)训练的版本被称为"暖暖-Inst",是后续强化学习阶段的起点。

**四、第三步:专门对付"剩余错误"的强化学习**

走完前两步,"暖暖-Inst"已经能回答约80%的企业问题了。但剩下那20%的错误,用普通继续训练的方式效果有限——因为那些容易学会的题目,模型早就学会了,继续在全部数据上兜圈子,收益越来越低。

这时候研究团队祭出了第三步:专门针对"剩余错误"进行强化学习。

具体做法是:先用"暖暖-Inst"去回答训练集里的所有230,183道题,然后用评判模型筛出那些它依然答错的题目,共筛出56,147道。这个错误题目池就成了第三阶段的专属训练集。

这种策略的思路,就像一个备考的学生,把所有做错的题目单独整理成"错题本",然后在考前集中复习错题,而不是把所有题目不分好坏地再过一遍。

强化学习采用的算法叫GRPO(一种效率较高的策略优化方法)。对于每道题,模型会生成5个不同的候选回答,然后系统给每个回答打分。打分规则包括四个维度:答案的事实准确性(占60%的权重)、逻辑合理性、专业表达质量、简洁性(三者合计占30%),以及格式规范性(占10%)。模型通过不断比较这些候选回答的得分差异,逐渐学会生成更好的答案。

为了验证"专攻错题"这一策略是否真的优于其他方案,研究团队设计了一个严格对照实验:三组模型都从同一个起点(暖暖-Inst)出发,都只训练100步,使用完全相同的算法和参数。唯一的区别是训练数据的来源:第一组只用56,147道错题,第二组从完整的230,183道题中随机抽取,第三组使用全部230,183道题。

实验结果显示,错题组达到了89.39%的可接受答案率,而完整池随机组和全量组分别只有86.42%和86.28%。差距看起来不大,但经过严格的统计检验,这3个百分点左右的差距是可靠的,不是随机噪声。研究团队还通过"按文件来源重新采样"的方式进行了额外的稳健性检验,结果同样支持错题策略的优势。

在主力的完整训练轮次中,"暖暖-RL"的可接受答案率最终达到91.51%,比"暖暖-Inst"又提升了11.45个百分点。从问题层面来看,这11.45个百分点意味着:原先答错的题目中,有101道被修复了;原先答对的题目中,有20道出现了退步;净减少了81个错误。

**五、用707道真实企业问题来考试的成绩单**

为了让整个评估体系可信,研究团队专门构建了一个名为"WnuanBench"的测试集,里面包含707道真实企业知识问题。

这707道题覆盖了8个业务领域,按内容类型分为三大类:160道通用企业知识题,370道实际操作场景题,以及177道标准规范题。所有题目都由企业内部人员独立筛选和审核,完全没有参与模型的训练过程,确保考试的公正性。

为了让评分本身也可信,研究团队使用了三个大型语言模型组成的"评审团":两个主审(gpt-oss-120b和MiniMax-M2.5)独立打分,如果两者意见不一致,就请第三个模型(DeepSeek-V3.2)来打破僵局,最终取三者的中间分数。

研究团队还做了一个重要的校准实验:请一位真正懂行的企业领域专家,对147道题的模型回答进行人工评分。对比结果显示,自动评审团与专家的判断吻合率高达90.5%,统计上的一致性系数(Cohen's κ)为0.796,属于相当高的水平。这意味着这套自动评分体系是可靠的,不是在自欺欺人。

在最终的成绩单上,"暖暖-RL"以91.51%的可接受答案率排名第一。而所有被纳入对比的商业AI接口,包括GPT-5.4、MiMo-V2-Pro、DeepSeek-V4-Pro等顶级系统,得分均在42.86%到67.75%之间。同一套问题上,差距非常显著。

**六、不止准确率:其他质量维度的变化轨迹**

可接受答案率只是最核心的指标,研究团队还追踪了几个辅助指标,它们共同描绘了模型从"暖暖-Base"到"暖暖-Inst"再到"暖暖-RL"的完整进化轨迹。

答案完整性(是否覆盖了所有关键要点)从36%提升到66.76%。答案忠实性(是否有据可查,不瞎编)从30.20%提升到72.14%。幻觉率(模型编造不存在内容的比例)从65.91%大幅下降到15.70%。这意味着,训练前的模型有超过六成的答案含有编造成分,训练后降到了不到两成。

有一个细节值得关注:在各项指标的改善中,SFT阶段(第二步)贡献了大部分的准确性提升,而RL阶段(第三步)的最大贡献是对幻觉率的压制。RL阶段在非幻觉率上额外贡献了17.96个百分点,显示出强化学习对"让模型说话有依据"这件事特别有效。

**七、代价与边界:通用能力的损失**

没有什么是免费的。研究团队在强调成果的同时,也非常坦诚地报告了代价。

在通用能力测试上,"暖暖-Base"的三项通用测试平均分是88.61%,经过SFT之后降到84.64%,经过RL之后进一步降到83.44%,全程共下滑了5.17个百分点。但这个损失并不均匀:MMLU(知识广度测试)和C-Eval(中文知识测试)的降幅较小甚至略有回升,而IFEval(指令遵循测试)的降幅最大,从88.76%一路跌到了80.00%。这意味着,模型变得更擅长回答企业知识题,但在"严格按照给定格式回答问题"这件事上有所退步。

研究团队也尝试了继续用第三步强化学习来弥补这一损失,专门设计了一个"RL-2"扩展实验。结果显示,继续训练下去不仅没有找回指令遵循能力,反而让幻觉率从15.70%反弹到了20.93%,IFEval继续从80.00%跌至76.00%,可接受答案率几乎没有变化。这个实验虽然以失败告终,但它传递了一个重要信息:在当前的方案框架下,企业知识能力和通用指令遵循能力之间存在一定的内在张力,不能简单地"两头都要"。

**八、检索辅助:有时候反而帮倒忙**

论文还专门测试了一个额外问题:如果给模型配上检索功能(RAG,即在回答问题时先从文件库中检索出相关片段,再一并送给模型参考),会有帮助吗?

结果出乎意料地微妙。对于没有经过任何训练的基础模型(暖暖-Base),检索辅助确实很有帮助,可接受答案率从52.76%提升到72.98%。但对于经过完整训练的"暖暖-RL",检索辅助反而造成了下降,从91.51%跌到81.75%。

研究团队对这个现象做了进一步的拆解分析。他们发现,当检索到的片段确实与问题相关时,检索对基础模型和中间模型还是有帮助的;但当检索到的内容与问题关联度不高时,所有模型的表现都会变差,而且训练越充分的模型受干扰越大。这说明,检索辅助不是一个可以无脑叠加的"加成",而是需要根据检索质量来决定是否使用的条件性工具。

**九、还有一条671B巨模型的路线**

研究团队还顺带测试了一条不同的路线:基于参数量更大的DeepSeek-V3.1-Terminus(671B参数,远大于主力方案的32B)进行轻量级微调(LoRA-SFT),但没有进行强化学习阶段。这条路线被称为"暖暖-Plus"。

结果显示,"暖暖-Plus-Inst"达到了81.19%的可接受答案率,略高于同等SFT训练后的32B版本(80.06%),但明显低于经过强化学习的32B版本(91.51%)。这个对比说明,在同等训练阶段的条件下,更大的模型有一定优势;但精心设计的三阶段训练策略,可以让较小的模型超越仅做简单微调的更大模型。

**说到底,这套方案告诉了我们什么**

归根结底,这项研究做了一件很实在的事:它系统性地回答了"如何让一个通用AI掌握企业私有知识"这个问题,并且用严格的实验数据说话。

研究给出的答案是一套组合拳:先把文件转化为可学习的问答题,再在学专业知识的同时保留通用能力,最后用强化学习专门攻克剩余的难题。每一步都有清晰的作用分工,而不是依赖某一个单一技术的神奇效果。

这套方案也有明确的局限性。它只在一家企业的知识体系上得到了验证,无法保证在其他企业或其他行业同样有效。它改善了企业知识的准确性,但牺牲了一部分指令遵循能力。而且,由于涉及企业内部文件,完整的训练数据和测试集无法对外公开。

对于那些正在考虑将AI引入企业内部知识管理的实践者来说,这项研究提供了一个经过验证的参考框架,而不是一个可以直接复制粘贴的解决方案。每家企业的知识体系不同,直接照搬结果的风险还是存在的。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2608.01862查阅完整论文,里面包含了大量训练配置参数、评分标准定义和统计检验结果,是一份相当详尽的技术报告。

**Q&A**

Q1:Wnuan暖暖模型是如何把企业文件转化为AI可以学习的训练数据的?

A:暖暖系统会先把企业文件切分成有意义的文本片段,然后针对每个片段自动生成六种类型的问题,包括事实提取、机制解释、条件约束等,再经过一系列质量筛查,最终得到大约22万组问答对。此外,系统还会用目标模型对答案进行改写,使表达风格更贴近模型自身的生成习惯。

Q2:暖暖训练后通用能力下降了多少,具体哪方面受影响最大?

A:经过完整三阶段训练后,暖暖模型的三项通用能力测试平均分从88.61%下降到83.44%,总共下滑约5.17个百分点。损失最集中的是指令遵循能力(IFEval),从88.76%跌至80.00%,而知识广度测试(MMLU)和中文知识测试(C-Eval)的降幅相对较小。

Q3:为什么给暖暖-RL模型加上检索功能反而会让成绩变差?

A:检索功能会把检索到的文档片段一起送给模型参考,但检索到的内容不一定与问题高度相关。经过完整训练的模型已经内化了大量企业知识,反而容易被不相关的检索内容干扰。当检索内容与问题真正相关时帮助还是存在的,但检索质量不稳定时,训练越充分的模型受干扰反而越大。