皮尤研究中心的一项新分析显示,自ChatGPT于2022年底发布以来,互联网上由AI生成的文本内容比例显著上升。研究人员对近50万个英文网页进行了扫描,结果发现,在ChatGPT发布后新出现的页面中,超过三分之一带有明显的AI生成痕迹。

这项分析基于Common Crawl网络档案库中的文本样本,并使用AI检测工具Open Pangram进行识别。在2026年7月的样本中,约10%的被检网页显示出明确的机器写作特征。但如果只看ChatGPT发布之后上线的页面,这一比例急剧攀升至三分之一以上,且自2022年末以来,疑似AI生成的网页内容占比持续稳步增长。

打开网易新闻 查看精彩图片

商业网站是AI文本的重灾区

从域名类型来看,差异十分明显。约十分之一的.com商业域名网页含有AI生成文本的迹象,.org域名网站的这一比例为4.6%,而.edu教育机构和.gov政府网站的占比均仅约1%。这意味着,商业网站包含AI生成文本的可能性大约是学校或政府机构网站的十倍。

皮尤的分析还发现,自2023年以来,一些特定的语言模式在网络上变得愈发常见。例如,破折号(em dash)的使用频率比2023年翻了一番,牛津逗号的使用量则跃升了63%。

AI偏爱的词汇正在“泛滥”

一些AI模型偏爱的词汇,如“delve”(钻研)、“interplay”(相互作用)、“testament”(证明)、“pivotal”(关键的)、“landscape”(格局)、“tapestry”(画卷)、“bolstered”(增强)、“crucial”(至关重要的)、“meticulous”(一丝不苟的)和“vibrant”(充满活力的),在网上的出现频率均增长了一倍以上。遵循“it's not just X, it's Y”(不仅是X,更是Y)句式的否定平行结构,其出现频率也几乎增长了两倍,尽管在绝对数量上仍属少见。另一项针对企业公关文件的研究发现,这一特定句式自2022年以来使用量翻了四番。

2026年4月,伦敦帝国理工学院、互联网档案馆和斯坦福大学联合开展的一项研究也得出了类似结论。该研究发现,约35%的新发布网站是完全或部分由AI生成的。研究者还发现,AI文本之间的语义相似度高出33%,整体语气也更为积极,但他们同时提醒,公众对AI负面影响的感知往往远超数据实际支持的程度。

不过,这类研究本身也存在局限。皮尤研究中心指出,目前的检测工具很难准确区分完全由AI自动生成的文本与仅部分借助AI辅助撰写的文字,因此“AI文本”的界定标准依然模糊。