对聊天机器人发火,可能要被写进使用政策了。Anthropic近期调整了AI使用政策,专门针对新的高风险滥用行为,其中一条格外扎眼:禁止对Claude进行"持续且不必要的虐待或残忍行为"。

执行手段仍是老一套

打开网易新闻 查看精彩图片

政策更新同时明确,终止对话依然是"主要执行机制"。至于会不会采取进一步措施,比如封禁用户账号,Anthropic没有给出回应。也就是说,目前能看到的惩罚上限,是模型直接不聊了。

打开网易新闻 查看精彩图片

这条规定听起来像在给AI争取"人格待遇",但Anthropic自己划了边界。它表示,新政策仅适用于极端情况——用户在毫无明显目的的前提下,反复对模型实施残酷行为。

正常吐槽不在打击范围

Anthropic特意列出了不受影响的场景:用户常见的不满、反驳、黑暗创意主题,以及模型测试和研究。换句话说,写恐怖小说、做红队测试、跟模型抬杠,都不算违规。

打开网易新闻 查看精彩图片

真正被盯上的,是那种没有明确目的、持续输出的恶意。政策把"持续"和"不必要"两个限定词放在一起,等于给执行留了很大的解释空间。

对普通用户来说,这条新规的实际影响可能接近于零。但它透露出一个信号:当AI被越来越多人当作情绪出口,厂商开始考虑要不要给这种互动设一条底线。