一份新的NBER论文介绍了一套开源LLM工作流,它复现了4452个经济学复现包,在3460篇文章中标记出偏差,并对另外数百篇的计算做了改进或扩展。

这组数字放在经济学研究里并不常见。复现一直是这门学科的老问题——代码、数据、计算步骤散落在不同作者手里,人工逐篇核对成本极高,很多偏差因此长期沉在论文里没人发现。

打开网易新闻 查看精彩图片

它具体做了什么

按论文的描述,这套工作流是开源的,任务指向很明确:把复现包跑一遍,看结果能不能对上原文。4452个复现包是它的处理规模,3460篇文章是被标记出偏差的部分。

偏差之外还有一类结果:数百篇论文的计算被改进或扩展。也就是说,这套流程不只是判断"对不上",还在部分场景里给出了更好的算法路径。

为什么值得关注

经济学研究的可信度很大程度建立在复现之上。当复现的规模从个位数、几十篇扩大到四千多个包,问题的暴露方式就变了——不再依赖某位研究者对某篇论文的怀疑,而是批量扫描。

开源这个选择同样关键。工作流公开意味着其他研究者可以拿去跑自己的领域,也可以核查它标记出的偏差是否成立。工具本身成了被检验的对象。

4452和3460这两个数字放在一起,说明偏差不是个别现象。至于这些偏差具体是什么性质、分布在哪些方向,论文给出了它的判断,后续的讨论大概率会围绕这套流程的准确度展开。