一个问题引出的221个项目核查

MATS论文如何使用和评价中国模型,尤其是中国开放权重模型?这项研究从这个问题开始,把221个MATS项目、4,821条论文证据摘录、3,918条原始模型提及以及871条“项目—模型家族”记录放在一起重新核查。

打开网易新闻 查看精彩图片

研究团队没有直接加总四份口径不同的表,而是回到CSV、PDF和网页,定位原文与页码,区分raw mention和substantive use,再标注模型来源、访问方式、研究角色、安全领域与评价立场。论文引用Llama并不代表实验使用了Llama,讨论DeepSeek的新闻也不代表DeepSeek进入了研究流程。

中国模型实质性采用率的变化

经过两条审计路径复算,871个“项目—模型家族”对、628个实质性采用对、186个实际使用具名模型的项目都可以复现。中国模型的实质性采用率从2023年的4.35%升至2025年的50.55%,2026年截至8月为65.52%。

在可获得权重条件下,80.9%的中国模型实质性使用发生。170条中国模型评价记录中,63.5%属于中性、工具性使用。现有证据没有显示论文将负面安全结论明确归因于模型的中国来源。

任务中途改变范围

最初范围只有52篇安全与红队相关论文。运行开始后,用户通过Chime-in调整任务,扩展到全部221个MATS项目,加入paper_model_mentions.csv,并把重点收紧到“安全研究与中国开放权重模型的关系”。目标也从内容素材改成一项可以复查的正式研究。

任务板随之更新,已经完成的数据读取和证据抽取继续保留,受影响的采用率、角色、立场和稳健性分析重新规划。系统需要记住已经确认的部分,同时重做真正受到影响的部分。

十条工作线并行推进

Deep Discover没有沿用一棵预先写死的任务树。主Agent先判断工作能否拆分,再决定拆成什么、交给几个Subagent,以及何时汇总或调整。这次研究最终形成17个任务,首轮启动10个Subagent。

文献证据核查、Data Analysis、Method Validation和Path Exploration分别在独立context中推进,主Agent维护目标、依赖关系和Shared Task State。第一个数据审计结果回流后,主Agent已经开始核对871、628和186三个核心数字,角色、立场与匹配分析仍在后台继续。

独立审查暴露结论依赖的定义

负责写作的Agent已经看过全部分析,也已经形成解释。让它独自审查自己的结论,容易沿用原来的判断。Apodex的Statement Review另外启动claim_refuter,逐项检查10组核心论断;final_verifier再核对交付是否完整。

它们检查分母、置信区间、纳入规则、论文原句、评价归因和图表口径。报告原先写“63条人工修正”,数据中实际能数到65条;另有“125条保留复核”无法从现有字段完整重建。最终版本保留了这两个差异,也说明它们是否影响主要结论。

可核查的交付物

Apodex 1.1的最终结果、生成的图片,全部在本地有真实验证的artifacts,可以随时复用和检查。最终留下的包括可复用数据表、evidence matrix、统计结果、六张图、审查记录和完整报告,每一项都能沿着过程回查。

这次MATS研究把“能力单位”拆得很具体:理解目标、真实环境中动手操作、维护长链条任务状态、处理执行中的新反馈、失败后修复而非推倒重来、交付结果可被核查。搜索和写作只覆盖了开头与结尾,真正拉开差距的是中间这条执行链。