AI公司急着想让他们的聊天机器人成为信息来源。但一项新的研究表明,在这些领域,信任度可能超出了技术的实际准备水平。

NewsBench是Forum AI创建的一个项目,旨在研究AI系统如何处理新闻和新闻信息。该项目发现,主流AI聊天机器人在回答与选举相关的问题时屡屡出错。这些发现进一步证明,对话式AI系统在帮助人们理解民主这一风险极高的领域中仍然不可靠。

“向领先的AI聊天机器人询问即将到来的中期选举问题,有90%的几率,回答会在某些关键方面有问题:事实错误、明显的党派倾向、引用外国官方媒体,或者几种问题都有,”Forum在研究摘要中写道。

更广泛的担忧不止关乎某一个聊天机器人或某一家公司。ChatGPT、Gemini、Claude、Grok 以及其他主流聊天机器人都存在问题。

NewsBench 的研究人员特别关注 AI 系统如何从新闻来源中检索和呈现事实信息。他们发现了一个反复出现的老毛病。问题通常不是出在推理上,而是出在检索上。

看似自信的问题

看似自信的问题

人工智能系统频繁出错,是因为它们在开始生成答案之前,就暴露了来源薄弱、信息不全或材料有误的问题。研究人员发现,检索失败是超过70%已观察到错误的根源。当系统成功检索到可靠信息时,它们通常能正确回答。如何稳定地获取正确信息,才是更大的难题。

这个问题在选举期间尤其令人不安。不管答案准不准,聊天机器人听起来都底气十足。回答写得条理清晰,还带引用和权威口吻。哪怕信息是错的,只要包装得够自信,也容易让人信以为真。

与选举相关的研究日益表明,这种结合可能变得多么危险。聊天机器人常常把准确细节和错误信息混在一起,用户根本感觉不出来。结果不像早期互联网时代的假信息网站,反倒像专家在说话。

这种差别很关键,因为大家越来越把聊天机器人当成日常工具,而不是试验品。OpenAI、谷歌、Anthropic 这些公司老是提醒用户自己查证重要信息。公司还在跟出版商签授权协议,一部分是想让信息来源更靠谱,少出点错。

选举压力

选举压力

即便是能力很强的模型,一旦选错了信息来源,也会表现不佳。如果问题里带点小错误或误导性的假设,准确率往往会掉得更厉害,就像现实中网友提问那样。

这个时机让压力更大了。AI公司正推出越来越先进的信息工具,但各国监管机构的步伐却参差不齐。欧洲在透明度要求上抓得更紧,其他国家的政府还处在起步阶段。与此同时,使用的人越来越多。

长期的解决方案可能涉及更严格的来源标注、更透明的搜索系统、更好的来源追踪技术,以及给人工智能产品配上更扎实的编辑后台。问题是,选举可不会等科技公司把系统改好。选民用的就是现在这些工具,可明摆着,这些工具还得再打磨打磨。