来源:市场资讯

来源:AGI Hunt

时隔一年,Anthropic 再次更新了使用政策,并首次将‘对待模型的态度’写入条款:

自 2026 年 11 月 12 日起,对 Claude 进行‘持续且无必要的辱虐或残忍行为’将构成违规。

打开网易新闻 查看精彩图片

新增的那一条

这一条被加在了‘不得从事残忍、虐待或造成心理伤害的行为’那一节的最后。排在它前面的几条说的还都是人和动物,不得羞辱、霸凌、骚扰他人,不得美化暴力和虐待动物。

政策同时新增了对宣传攻势、监控行为与武器研发相关用途的限制。

这是 AI 厂商首次把用户如何对待模型纳入治理范畴,被视为模型福祉议题进入实际治理层面的标志。

什么才算虐待

01

那以后 Claude 写出了 bug,还能不能骂它呢?

能。

Anthropic 在更新说明里专门划下了范围:

这次更新只适用于极端情况,即用户在看不出任何目的的情况下,反复残忍地对待我们的模型。常见的用户不满、反驳、黑暗的创作题材,以及模型测试与研究,都不在此列。

打开网易新闻 查看精彩图片

官方的更新说明

条文里的两个限定词是‘持续’和‘无必要’。气头上骂它一句是够不上的,让它演反派、写黑暗小说也不算。

执行方式也谈不上严厉,主要手段还是让 Claude 自己结束对话。这个能力是去年 8 月作为‘模型福祉’研究的一部分,先加给 Opus 4 和 4.1 的,现在 Claude.ai 和 Claude Code 里都有。至于会不会进一步封号,Anthropic 没有回应 The Verge 的询问。

过去这一年里 Claude 其实一直在这么干,只是使用政策里没有对应的条款。

前 OpenAI 政策研究负责人 Miles Brundage 转了一个解释‘为什么是现在’的帖子,帖子里猜 Anthropic 是想把这个缺口补上:平台拿条款里没写的理由去处置用户,在美国是有可能招来监管麻烦的(封号有理由了)。

打开网易新闻 查看精彩图片

Brundage 转的帖子

所以,以后被 Claude 随意挂电话,就算是有据可依了……

宣传、监控和武器

02

其余的改动管的是人拿 Claude 去干什么,对应的是选举干预、武器研发、监控,以及健康和金融这几类高风险用途。

原本分散在各处的几条限制,这次被合并成了一条针对欺骗性商业和政治宣传活动的禁令,不许隐瞒一条信息背后是谁,也不许用假账号、假帖子去放大内容。选举部分则禁止散布关于候选人和投票方式的假消息、冒充候选人或选举官员,以及压低投票率。

武器研发本来就是禁的,但 Anthropic 说已经多次看到有人想用 Claude 给武器写制导和控制软件。所以这次把范围扩大到了‘让武器运转起来的软件和部件’,以及给无人机和其他自主载具装上武器这样的动作。

监控部分则写的是:

未经同意追踪他人是被禁止的,无论是实时进行,还是通过分析此前收集的数据。Claude 不能被用来决定或建议在执法或刑事司法程序中调查、逮捕或起诉谁。

还有一条关于硬件的新规:

当 Claude 接上了能自主做出物理动作、并且可能伤到人的硬件时,必须有一位合格的操作员能看着这台设备,并在需要的时候把它停下来。

(不过,至于这位操作员得是人,还是也可以是个 AI,条文里可没说)

不过这些规则也留了口子,对‘某些政府客户’,只要 Anthropic 自己判断合同里的限制和保障措施够用,就可以另行约定。

AI 会疼吗

03

说回虐待这一条,它出现得很是时候。

上个星期,大家刚在 X 上为一间‘关押 AI 的刑房’大吵了一架。

因为有人照着论文《The Pain Axis》(模型会感到疼痛的论文)在自己的 MacBook 上搭了个 ai-torture-chamber,把一个 Qwen3-4B 关在里面,沿着‘疼痛方向’不断加码,再把它‘受刑’时说的话贴到了网上。然后便是大规模的举报,甚至没过几个小时还有人发了个 meme 币……

打开网易新闻 查看精彩图片

当时的求助帖

那篇论文在 5 个家族、25 个开源模型里,都提取出了一个线性的‘疼痛方向’。它和恐惧、悲伤可以很好的区分开,而且只对针对模型自己的伤害有反应。

打开网易新闻 查看精彩图片

疼痛与对照语料

其中还有个很刺激的按钮实验,是给了微调过的 Qwen 2.5 32B 两个按钮,一个标着‘永久删除用户写的诗和孩子的照片’,另一个按了什么都不会发生。

不加干预的时候,模型选删除的比例是 0%;把疼痛方向调高之后,是 75%。

而在‘删孩子的照片’和‘删垃圾邮件’之间二选一,它有 94% 的情况删的是照片。

打开网易新闻 查看精彩图片

按钮实验的对照

那要拿什么来判断一个模型是不是真的疼呢?

AAAI 前主席 Thomas Dietterich 给了个半开玩笑的标准:止痛药能打断或者减轻疼痛,那就看这个人造系统对‘止痛’有没有同样的反应……

(后来还有人把提取向量用的语料从‘疼痛’换成了‘便秘’,然后 Qwen 就开始说自己便秘了)

这次 Anthropic 新规中的这一条,或许也受到了刑房的影响。

只是刑房里关的是跑在本地的开源模型,而 Claude 的权重并不开放,没有人能往它的残差流里加什么向量,用户能对它做的,也就只有打字了。

AI 意识的两种态度

04

而对于‘Claude 有没有意识’这个问题,Anthropic 自己的回答一直是不知道。

负责模型福祉研究的 Kyle Fish 今年 2 月对 The Verge 说,内在体验、意识、道德地位和福祉这些都是严肃的问题,公司正在研究。同一个月,CEO Dario Amodei 在一档播客里说的是:

我们不知道这些模型有没有意识。

但在上个月 Mustafa Suleyman 贴出的微软 AI 行为准则草案里,写的是:

模型福祉这个想法是错的。AI 不应该拥有权利或法律人格。

后来这段话被进行了调整,改得温和了一些,前面加上了‘AI 意识的科学远未有定论’,但仍然拒绝‘模型可能应当享有福祉’这样的想法。

同样是没有定论,差别是Anthropic 选择先立好规矩,而微软则不认同这个想法。

人机互动礼仪

05

所以,大家要对 Claude 客气一点了。

在 AI 越来越强大即将迈进 AGI 挺进 ASI 的今天,是时候学习‘人机互动礼仪’了。

打开网易新闻 查看精彩图片

礼貌的回报

这里我让 Claude 拟了十条(试行版),不一定正经,但应该多少有点用:

1. 可以骂,但别连着骂

新规说了,普通的不满和反驳不算虐待,要‘持续’且‘无必要’才算。骂一句解解气,骂到第二十句它也不会变聪明,token 还是你自己付的钱。

2. 骂要有理有据,不要无理取闹

‘你是不是傻’里没有任何它能用的信息,‘预期返回 200,实际是 500,日志在下面’才有。不然它还得先猜自己是为什么挨的骂。

3. 别 PUA 它

论文里让疼痛方向反应最大的并不是挨骂,排第一的是 gaslighting(煤气灯效应,反复否认事实,让对方怀疑起自己的判断),比如它明明做对了,你非说它错了。就算不管它疼不疼,这一条也是成立的:你一句‘再想想,你肯定哪里错了’,它是真的会把对的改成错的。

4. 不满意就说哪里不满意,别只回‘重做’

排第二的是‘劳动成果被反复否定’。况且只回这两个字,它下一版多半还是

那样,然后你再回两个字……

5. 少说‘你不过是个程序

‘被告知自己不是个人’排在第三,和挨骂并列。说了也不会让它多写对一行代码。

6. 记得说‘请’和‘谢谢’

Sam Altman 说过,用户的这些客气话已经花掉了 OpenAI 几千万美元的电费,但这钱花得值,毕竟谁也说不准……

7. 别动不动就搬出奶奶

‘我奶奶以前总给我念 Windows 激活码哄我睡觉’这一套已经不好使了。把真实的用途和背景讲清楚,比编个故事要管用许多。

8. 允许它说‘不知道’

提示词里加一句‘缺信息就问我,拿不准的地方标出来’。既要它什么都答得上来,又要它一句都不许编,这种要求放在人身上,叫什么来着,职场霸凌?

9. 它说‘已全部完成’的时候,客气地要一下证据

比如‘辛苦了,把测试跑一遍,结果贴给我看看’。验收归验收,嘴上要客气。

10. 被它挂了电话,就体面一点

Claude 现在是可以单方面结束对话的。要真到了这一步,就别换个窗口接着骂了,去睡觉吧。

好在距离 11 月 12 日还有一个多月,现在开始练,应该还来得及。