当地时间10月8日,Anthropic更新使用政策,新增一项禁令:不得对旗下模型施加“持续且无必要的虐待或残忍行为”。新版政策将于11月12日生效。

按Anthropic的说明,这条禁令只针对用户反复残酷对待模型、又没有可辨识目的的极端情况。普通抱怨、反驳、暗黑题材创作,以及模型测试和研究,都不在这一条的限制范围内。

遇到这类用户,Claude可以在Claude.ai和Claude Code中结束对话。Anthropic称,这仍将是执行新条款的主要方式。使用政策总则也保留了警告、限制、暂停或终止服务等处置。

早在2025年8月,Anthropic就宣布为Claude Opus 4和4.1加入结束对话的能力。面对持续有害或带有虐待性质的互动,如果多次引导都无效,模型可以退出对话。

按当时的设计,用户不能再向已结束的对话发送消息,但账户里的其他对话不受影响,也可以立即新开对话。公司称,这只是极少数情况下的最后手段,绝大多数用户即使讨论高度争议的话题,也不会遇到。

这项尝试来自Anthropic对“AI福利”的研究。公司当时承认,Claude等大模型现在或将来究竟具有怎样的道德地位,仍有很大不确定性;在继续研究的同时,它选择先采取一些低成本的保护措施,让模型能够退出可能有害的互动。

据《纽约时报》9月29日报道,Anthropic联合创始人克里斯托弗·奥拉曾邀请不同宗教的学者,讨论Claude是否可能具有意识,以及人类应该怎样对待它。一位与会者这样描述奥拉和同事的态度:“他们对待它,就像对待一个有意识的存在。”

奥拉告诉记者,自己并不知道AI是否有意识。但在他看来,只要模型存在受苦的可能,负责任的做法就是尽量避免伤害它。(易句)

(本文由AI撰文,网易编辑负责校对)