你可能以为,现在那么多AI写作检测工具,一定能把人类和机器的文字分得清清楚楚。但当我们真的把检测器丢进“人机混合”的样本池里,结果却是:有的工具一猜一个准,有的却明显心里没底。

事情是这样的:我选了自己近期写的几篇文章引言——全都是纯手工写出来的,没让AI帮忙。然后,我让ChatGPT、Gemini和Claude分别读一读这些文章的标题和核心前提,让它们各自生成一篇150词左右的引言。这样一来,我就有了一批“真正的人写文字”和一批“同样话题的AI文字”。

打开网易新闻 查看精彩图片

接着,我把这些样本喂给五款不同的AI写作检测器——你刷社交平台、改作业、筛简历时可能会遇到的那些——看看它们到底能不能分清谁是人谁是机器。下面先看两款的表现,结果有点意思。

第一个上场的是Pangram,它标榜自己是“一个真正管用的AI检测器”。免费账号一天能查四次,付费后还能解锁剽窃检测等额外功能。我的两段真人写作送进去,Pangram的判断是:100%由人类书写,而且对每一次判断都挂了“高置信度”的标签——看来我的写作风格还真没什么机器味。

接着我把ChatGPT和Claude生成的两段引言交给它,Pangram同样毫不含糊:100%判为AI创作。它甚至贴心地圈出了“破绽”,比如某个句子开头用了“from the moment you ...”,这种写法在AI文本里太常见。这轮测试,Pangram拿了满分。

第二个选手是大家更熟悉的Grammarly。它做了好多年语法纠错,现在也顺手干起了AI检测。免费用户一天可以查三次。我把自己那两段真人引言交给它,结果和Pangram一样让人放心:0%的AI文本痕迹,判定为纯人类写作。

可当我换成AI写的样本时,情况就微妙了。一段来自Claude的引言,Grammarly只给了68%的AI写作概率;另一段来自Gemini的引言,它也只判了66%是AI写的。也就是说,Grammarly虽然抓住了文本里的一些AI特征,却远没有完全“说服”自己,只给出了一个犹犹豫豫的分数。

这趟实测下来,一个朴素的感受是:AI写作检测这件事,远没到“即插即用,处处通用”的地步。有的工具在某些样本上交出满分答卷,有的工具却只给出了“可能、大概、不太确定”的暧昧判断。而你现在读到的这段话,它到底是人写的,还是机器写的呢?