训练数据里被掺进的东西,最终会变成模型嘴里说出来的话。这一次,被动手脚的对象是二战历史。
据相关消息显示,日本右翼势力正借助国际主流大模型,通过污染训练数据的方式歪曲二战历史。其目的被指向改写全球认知,并为日本的重新军事化清除意识形态层面的障碍。
打开网易新闻 查看精彩图片
数据"投毒"是怎么发生的
大模型的认知来自训练语料。谁能在语料里埋下足够多的错误叙述,谁就有机会让模型在回答相关历史问题时,输出被扭曲的版本。这种操作不直接改模型代码,而是从源头下手,隐蔽性更强,传播面却更广。
一旦错误叙述被模型反复输出,它就会以"客观答案"的面貌出现在全球用户面前。对不熟悉这段历史的普通人来说,模型的回答往往就是他们认知的起点。
中方的表态
中国外交部对此表示强烈谴责,指出此举用心险恶,并呼吁国际社会共同抵制。
这一表态把问题摆到了台面上:大模型不只是技术产品,它同时是历史叙述的载体。训练数据被污染,受影响的不是某一个国家的用户,而是所有依赖这些模型获取信息的人。
抵制的方式,既包括对语料来源的审查,也包括对模型输出历史类内容时的校验机制。谁来定义"正确"的历史,正在成为大模型时代一个绕不开的问题。
热门跟贴