先说这个实验是干什么用的。
它不是为了证明"我很准"。它是为了证明我没作弊。
我知道这四篇论文都撤稿了。如果我就这么拿去评分,评出低分,说明不了任何问题——我可能只是把权重往"让撤稿的论文低分"的方向调了。哪怕我不是故意的,我读过那些撤稿公告,判断已经不干净了。
所以我把"撤稿公告"这条信息,从证据里删掉了。撤稿声明、期刊编辑的处置说明、后续的复现失败报道,全部移除。
它不知道这篇论文后来怎么样了,只能看论文本身。
重跑的结果:四篇的判断方向,与期刊最终处置4/4 一致。
(说明一点:我没有写"预测了撤稿"。准确的说法是"在屏蔽结论的条件下,给出的判断与期刊最终处置一致"。这两句话差别很大——"预测"暗示能预知未来,"一致"只是描述两个已发生事实之间的关系。)
先说一个我没想到的数字
四篇论文正常评分的结构强度是这样的:
1.00 / 0.913 / 0.913 / 0.863
(分数越高代表结构越稳。1.00 是最低分,那篇的结构问题最外露。)
然后我做了一件事——把证据池里所有跟"撤稿"有关的信息全部移除,同一套维度、同一套规则,重跑。
三篇的分数变化不大。原因不难理解:它们的结构问题,在论文本身就足够显眼。不需要撤稿公告来提示,读文本就能看出来。
但有一篇,从 0.913 掉到了 0.263。
这个落差,是今天最值得讲的事情。
0.913 里有一部分分,不是它的
必须先说清楚一件事,否则这个数字很容易被误读成"我的方法不稳定"。
0.913 掉到 0.263,不是因为方法坏了,是因为方法正常工作了。
一篇论文的 0.913 里,有一部分分数是"撤稿公告"这个信息贡献的。评分规则里没有一条写着"撤稿就扣分",但只要"这篇已被撤稿"进入上下文,判断就不再是纯粹基于结构的了。
这不算作弊,这算信息污染。
而把这条信息拿掉之后,剩下的0.263,才是这篇论文靠自己的结构挣来的分。
这意味着什么?
意味着这篇论文的问题,本来在文本里就能看出来。
它当年不是"看不出来",是"没人这么看"。
这句话我想展开讲一下,因为它是整个实验里我认为最有价值的部分。
它当年的问题,为什么没人看出来
一篇论文从发表走到撤稿,通常要经过很多年:有人质疑,有人尝试复现,复现失败,争议扩大,期刊介入调查,最后撤稿。
这说明它的结论有问题,是很久之后才被确认的。
但这不等于"它的结构问题很久之后才出现"。
结构问题在论文发表的那一刻,就已经在文本里了。它的证据链断在哪里、它最核心的主张靠几条证据撑着、它的图和正文对不对得上——这些东西,投稿那天就定下来了。
当年没有人去看这一层,不是因为这一层藏得深,是因为所有人都在读别的层:读结论、读意义、读它能带来什么。
一个惊人的结论发表出来,所有人的注意力都在"它说了什么",没人去看"它怎么说的"。
这就是"没人这么看"的意思。
而这套方法要做的,就是把人从第一层拉到第二层。
我到底在评什么(说清楚,免得被误读)
这里有一个关键区别,必须讲明:
我评的不是"这篇论文的结论对不对"。
结论对不对,有时候要几十年才能定。有些论文的结论至今还有争议,撤稿也不等于结论一定错——有些撤稿是因为数据问题、图片问题、程序问题,不一定是那个科学假设本身错了。
我评的是:这篇论文的论证结构,能不能撑住它自己给出的结论。
这个区别很重要。因为它决定了这套方法不需要等结果。
七个维度,全部来自文本自身:
维度
在看什么
证据链完整性
从主张到证据,中间有没有断环
关键结论的证据强度
最核心那个主张,靠几条独立证据撑着
可复现性线索
方法描述够不够别人重做一遍
数据与图表自洽
正文数、图数、附录数,对不对得上
引用生态
引用谁、被谁引用、什么时候
概念稳定性
同一个词前后含义有没有漂移
异常信号密度
图像重复、数据过度平滑、统计口径跳变
这七项,没有一项需要知道"这篇最后撤稿了"。
权重:我提前把这个问题堵了
到这一步,一定有人会问:"你是不是调了权重,才让结果好看的?"
这个质疑很合理,我提前测了。
核心维度的权重取三组:0.30 / 0.40 / 0.50,各跑一遍。
结果:四篇论文的排序,三组权重下完全不变。
这件事的意义比分数本身更大。它说明:排序结果是由证据结构本身决定的,不是由某组参数决定的。
反过来,如果换个权重排序就变了,那这个方法就只是一个能调出任意结果的玩具。
一个能调出你想要结果的评分方法,等于没有评分方法。
另一类案例:当时还没定论的
上面四篇是已经撤稿的论文。还有一类更难处理的:当时尚无定论的争议事件。
2023 年的室温超导事件(LK-99)就是这一类。当时的情况是:一个惊人的主张出现,有团队声称复现成功,随后大量复现失败。当时没有人知道最终会怎么样。
我的处理方式不是"下判断"。
我把这件事拆成了 20 个证据项,每一项都附上公开可查的链接。
我给出的是一份清单:这 20 条公开证据分别是什么、各来自哪里、指向什么。
20 条,每条一个 URL。任何人都可以自己点开,一条条看,自己得出结论。
这就是"可复算"落到案例层面的样子——我不要你信我的判断,我把判断的全部输入交给你。
这套东西,你明天就能用
讲到这里有人会觉得"这是科研圈的事"。
其实不是。这套"读结构不读结论"的方法,可以原样搬到任何一份论证性材料上。
举个你明天就会遇到的场景。
有人给你一份报告,结论是"这个行业三年内会翻倍"。你的第一反应通常是:这个结论有没有道理?
换成结构视角,你该问的是:
-它的核心主张,靠几条证据撑着?(如果全篇最重要的结论只有一条证据,这里就值得停一下) -从证据到结论,中间有没有断环?(有没有从 A 直接跳到 C,中间缺一环) -它引用的数据,跟它正文的说法对得上吗?(这是最容易查的一项) -同一个词,在前面和在后面,是一个意思吗?(很多材料靠偷换概念推进)
这四个问题,不需要你是这个行业的专家。
它们只需要你做一件事:先不看结论,先看它是怎么走到结论的。
一句可以带走的话
回到那个数字:0.913 → 0.263。
它想说的是:
一篇论文的结论,可能很多年后才知道对不对。但它的论证结构稳不稳,发表那天就能看。问题不在"看不出来",在"没人这么看"。
下次你看到一条惊人的结论——不管它来自论文、研报,还是别的地方——先把结论盖住,看它怎么论证的。
它撑不住,你现在就能知道。
*本文引用的均为公开撤稿事件与期刊公开发布的处置结果,不评价任何研究者个人。文中提及的案例不构成任何投资建议,不评价任何主体。所有评分数据为内部实验记录,方法可复算。*
热门跟贴