一个名为ProofRay的项目最近公开了代码仓库。它既不是另一个聊天机器人,也不是对检索增强生成(RAG)的简单封装。作者想验证一个更直接的想法:记忆和文本生成是不是两个不同的问题。

大模型擅长写作,但不该当记忆权威

打开网易新闻 查看精彩图片

大语言模型很会写。即使记错了内容,它们也能把答案说得自信、自然、有用。这对很多任务没问题,但对个人记忆、技术文档、日志这类场景来说,“我觉得这就是答案”并不够。ProofRay被放在模型之前,接收文档和问题,把问题路由到源材料,核对身份、片段和摘要,并尝试为答案闭合一个证明。

证明闭合后,它才给出答案。材料有用但不完整时,它返回证据。权威不足时,它选择不回答。关键约束是:仅凭相关性不能直接变成被断言的答案。核心部分在本地运行,做记忆决策时不需要嵌入模型,也不需要大语言模型。模型可以在ProofRay之后接入,但只能作为已授权结果的阅读者或改写者。

四组端到端测试:无模型版本得分最高

作者在MemGym-DR上跑了四条端到端消费路径,使用当前默认/通用记忆配置。分数越高越好:

  • ProofRay独立运行,无大模型:0.7975
  • ProofRay加Gemini Flash-Lite润色:0.6125
  • BM25 RAG加Gemini Flash-Lite:0.5583
  • ProofRay加Qwen3 1.7B Q8本地模型:0.4975

让作者意外的是独立运行的数字。他原本预期大模型会让最终答案更好,结果“润色”步骤经常让答案变差:丢掉一个重要条件、改掉一个细节、把证据合并成断言,或者把一次不回答变成听起来更完整的内容。这不意味着Gemini或Qwen不好,而是它们不应该成为记忆的权威。

本地小模型接近传统云管线

本地Qwen运行也值得注意:一台自己机器上的1.7B Q8模型,落点接近传统BM25加云端Gemini管线。作者没有声称小本地模型在通用能力上匹配Gemini,而是说更好的记忆架构似乎能降低回忆任务对模型规模的需求。

作者明确列出的限制

这些是消费开发基准数据,不是对通用性能的封闭声明。ProofRay不能理解每一种可能的问题、语言、关系或领域。默认配置面向通用来源锚定记忆,另有一个单独的个人配置用于对话/用户记忆场景。仓库保留了失败实验和限制说明,而不是隐藏它们。

作者把它作为公开alpha发布,希望有人把真实文档、奇怪的“记得当时……”问题、冲突笔记以及没想到的案例扔给它。仓库地址是https://github.com/kyuubyN/ProofRay。作者表示,比起一句泛泛的“看起来不错”,他更想收到一个清晰的失败案例。