当编辑在稿件上看到“AI含量87%”的标记,并以此拒绝支付酬劳时,他依赖的仅仅是一个数字——而这个数字,至今没有任何独立实验室能在可接受的可靠性水平上复现。这是目前最严格的独立测试得出的结论,该测试发表于2023年,此后未再出现针对现行版本检测器的公开独立复测。 由德博拉·韦伯-武尔夫领导的研究团队,对包括Turnitin和PlagiarismCheck在内的14款检测器进行了测试。测试集涵盖人类撰写的论文、纯AI生成文本、机器翻译文本以及改写版本。结果显示:没有任何一款工具准确率超过80%,只有5款超过70%。更有6款检测器将人类文本误判为AI生成,13款漏掉了真正由AI生成的内容。表现最差的是翻译和改写文本——这正是自由职业者常遇到的情况:他们基于外语资料创作,或经过多轮编辑修改草稿(Weber-Wulff等,arXiv预印本)。 这并非孤例。OpenAI在推出自家文本分类器仅半年后便将其关闭:该工具仅能正确识别26%的AI生成文本,同时将9%的人类文本误判为机器生成,尤其对1000字符以内的短文本误判更严重(TechCrunch报道)。而学术查重领域的权威Turnitin也公开承认:其宣称的“仅1%误报率”在实际应用中,句子级别的误报率约为4%,且其中超过一半的误判与真正的AI片段相邻——这意味着系统是在混淆边界,而非偶尔出错(Inside Higher Ed报道)。
打开网易新闻 查看精彩图片
热门跟贴