面对一个塞了175,000条笔记的知识库,多数人的第一反应是全面体检、逐条去重、把断链全部接上。但三套大模型跑完同一道深度研究题之后,结论指向了另一个方向:先别急着大扫除,分块比去重更关键。
三个模型,一个共识
GPT、Gemini、Grok分别被要求回答同一个问题:怎样在不破坏知识库的前提下清理17.5万条笔记。目标包括压缩存储、找重复、合并重叠内容、修复失效链接,以及判断孤立笔记是否构成隐患。三条研究路径最终收敛到大致相同的答案。
核心教训并不在于某一种去重技术有多精妙,而在于分析之前如何把语料切成合理的块。在这个量级下,逐条两两比对完全不现实。正确顺序是先做确定性分组和低成本的候选生成,把语义搜索或大模型判断只留给那些模糊的剩余部分。
清理顺序比工具更重要
一套可操作的流程大致如下:
- 先阻止新的损坏发生,避免并发写入继续制造同步冲突。
- 用哈希值删除完全重复的条目。
- 依据确定性的重命名映射修复失效链接。
- 按强标识符或窄主题块对候选对象分组。
- 只在块内使用模糊匹配和嵌入向量。
- 不确定的合并决策交给人工复核,而不是自动删除。
- 每轮清理后测量检索答案是否真的变好。
顺序本身构成了安全网:先止血,再处理确定项,最后才动用昂贵且可能出错的语义判断。自动删除被明确排除在模糊环节之外。
孤立笔记不一定是病
最让人焦虑的往往是那些什么都不链接的笔记。几千条孤立文件摆在那里,看起来像知识库的失败。但研究改变了这个判断:孤立本身并不自动构成问题。
精选笔记——决策记录、长期有效的洞察、概念枢纽——应当被连接起来并且可被发现。而原始导入、旧聊天记录、临时抓取和归档材料,只要保留元数据和来源信息,继续孤立存在完全可以接受。
强行把每个文件塞进图谱,只会制造装饰性链接、浪费时间,还可能让检索变得更嘈杂。所以当前立场很简单:如果一条旧笔记没有连接任何东西,有时候正确的动作就是别管它。
文件数量不是成绩单
清理的目标不是画出一张漂亮的图谱,也不是把文件夹压到最小。目标是改善知识库产出的答案。这意味着要在清理前后跟踪答案正确率、依据充分度、引用准确率和检索精度。图谱密度和孤立笔记数量只是诊断指标,不是最终分数。
完整研究还覆盖了知识库的实测状态、去重阈值、安全清理流水线,以及普通RAG与GraphRAG之间的取舍。全文已发布在GitHub上。
热门跟贴