先说这个实验是干什么用的。

它不是为了证明"我很准"。它是为了证明我没作弊。

我知道这四篇论文都撤稿了。如果我就这么拿去评分,评出低分,说明不了任何问题——我可能只是把权重往"让撤稿的论文低分"的方向调了。哪怕我不是故意的,我读过那些撤稿公告,判断已经不干净了。

所以我把"撤稿公告"这条信息,从证据里删掉了。撤稿声明、期刊编辑的处置说明、后续的复现失败报道,全部移除。

它不知道这篇论文后来怎么样了,只能看论文本身。

重跑的结果:四篇的判断方向,与期刊最终处置4/4 一致。

(说明一点:我没有写"预测了撤稿"。准确的说法是"在屏蔽结论的条件下,给出的判断与期刊最终处置一致"。这两句话差别很大——"预测"暗示能预知未来,"一致"只是描述两个已发生事实之间的关系。)

先说一个我没想到的数字

四篇论文正常评分的结构强度是这样的:

1.00 / 0.913 / 0.913 / 0.863

(分数越高代表结构越稳。1.00 是最低分,那篇的结构问题最外露。)

然后我做了一件事——把证据池里所有跟"撤稿"有关的信息全部移除,同一套维度、同一套规则,重跑。

三篇的分数变化不大。原因不难理解:它们的结构问题,在论文本身就足够显眼。不需要撤稿公告来提示,读文本就能看出来。

但有一篇,从 0.913 掉到了 0.263。

这个落差,是今天最值得讲的事情。

0.913 里有一部分分,不是它的

必须先说清楚一件事,否则这个数字很容易被误读成"我的方法不稳定"。

0.913 掉到 0.263,不是因为方法坏了,是因为方法正常工作了。

一篇论文的 0.913 里,有一部分分数是"撤稿公告"这个信息贡献的。评分规则里没有一条写着"撤稿就扣分",但只要"这篇已被撤稿"进入上下文,判断就不再是纯粹基于结构的了。

这不算作弊,这算信息污染。

而把这条信息拿掉之后,剩下的0.263,才是这篇论文靠自己的结构挣来的分。

这意味着什么?

意味着这篇论文的问题,本来在文本里就能看出来。

它当年不是"看不出来",是"没人这么看"。

这句话我想展开讲一下,因为它是整个实验里我认为最有价值的部分。

它当年的问题,为什么没人看出来

一篇论文从发表走到撤稿,通常要经过很多年:有人质疑,有人尝试复现,复现失败,争议扩大,期刊介入调查,最后撤稿。

这说明它的结论有问题,是很久之后才被确认的。

但这不等于"它的结构问题很久之后才出现"。

结构问题在论文发表的那一刻,就已经在文本里了。它的证据链断在哪里、它最核心的主张靠几条证据撑着、它的图和正文对不对得上——这些东西,投稿那天就定下来了。

当年没有人去看这一层,不是因为这一层藏得深,是因为所有人都在读别的层:读结论、读意义、读它能带来什么。

一个惊人的结论发表出来,所有人的注意力都在"它说了什么",没人去看"它怎么说的"。

这就是"没人这么看"的意思。

而这套方法要做的,就是把人从第一层拉到第二层。

我到底在评什么(说清楚,免得被误读)

这里有一个关键区别,必须讲明:

我评的不是"这篇论文的结论对不对"。

结论对不对,有时候要几十年才能定。有些论文的结论至今还有争议,撤稿也不等于结论一定错——有些撤稿是因为数据问题、图片问题、程序问题,不一定是那个科学假设本身错了。

我评的是:这篇论文的论证结构,能不能撑住它自己给出的结论。

这个区别很重要。因为它决定了这套方法不需要等结果。

七个维度,全部来自文本自身:

维度

在看什么

证据链完整性

从主张到证据,中间有没有断环

关键结论的证据强度

最核心那个主张,靠几条独立证据撑着

可复现性线索

方法描述够不够别人重做一遍

数据与图表自洽

正文数、图数、附录数,对不对得上

引用生态

引用谁、被谁引用、什么时候

概念稳定性

同一个词前后含义有没有漂移

异常信号密度

图像重复、数据过度平滑、统计口径跳变

这七项,没有一项需要知道"这篇最后撤稿了"。

权重:我提前把这个问题堵了

到这一步,一定有人会问:"你是不是调了权重,才让结果好看的?"

这个质疑很合理,我提前测了。

核心维度的权重取三组:0.30 / 0.40 / 0.50,各跑一遍。

结果:四篇论文的排序,三组权重下完全不变。

这件事的意义比分数本身更大。它说明:排序结果是由证据结构本身决定的,不是由某组参数决定的。

反过来,如果换个权重排序就变了,那这个方法就只是一个能调出任意结果的玩具。

一个能调出你想要结果的评分方法,等于没有评分方法。

另一类案例:当时还没定论的

上面四篇是已经撤稿的论文。还有一类更难处理的:当时尚无定论的争议事件。

2023 年的室温超导事件(LK-99)就是这一类。当时的情况是:一个惊人的主张出现,有团队声称复现成功,随后大量复现失败。当时没有人知道最终会怎么样。

我的处理方式不是"下判断"。

我把这件事拆成了 20 个证据项,每一项都附上公开可查的链接。

我给出的是一份清单:这 20 条公开证据分别是什么、各来自哪里、指向什么。

20 条,每条一个 URL。任何人都可以自己点开,一条条看,自己得出结论。

这就是"可复算"落到案例层面的样子——我不要你信我的判断,我把判断的全部输入交给你。

这套东西,你明天就能用

讲到这里有人会觉得"这是科研圈的事"。

其实不是。这套"读结构不读结论"的方法,可以原样搬到任何一份论证性材料上。

举个你明天就会遇到的场景。

有人给你一份报告,结论是"这个行业三年内会翻倍"。你的第一反应通常是:这个结论有没有道理?

换成结构视角,你该问的是:

-它的核心主张,靠几条证据撑着?(如果全篇最重要的结论只有一条证据,这里就值得停一下) -从证据到结论,中间有没有断环?(有没有从 A 直接跳到 C,中间缺一环) -它引用的数据,跟它正文的说法对得上吗?(这是最容易查的一项) -同一个词,在前面和在后面,是一个意思吗?(很多材料靠偷换概念推进)

这四个问题,不需要你是这个行业的专家。

它们只需要你做一件事:先不看结论,先看它是怎么走到结论的。

一句可以带走的话

回到那个数字:0.913 → 0.263。

它想说的是:

一篇论文的结论,可能很多年后才知道对不对。但它的论证结构稳不稳,发表那天就能看。问题不在"看不出来",在"没人这么看"。

下次你看到一条惊人的结论——不管它来自论文、研报,还是别的地方——先把结论盖住,看它怎么论证的。

它撑不住,你现在就能知道。

*本文引用的均为公开撤稿事件与期刊公开发布的处置结果,不评价任何研究者个人。文中提及的案例不构成任何投资建议,不评价任何主体。所有评分数据为内部实验记录,方法可复算。*