就在不久前,从硅谷的一家人工智能公司传出了一条令人瞠目结舌的“禁令”。
“禁止用户对Claude模型实施持续且无合理目的的辱骂或残忍行为。”
你没看错,骂AI,现在要被管了。
有人觉得离谱,“我每个月花20美元订阅,结果连骂两句都不行了?”
另一派则认为,不管你觉不觉得AI有感受,故意折磨一个东西本身就是一种病态行为。
先别急着站队,这件事的来龙去脉,比一句“AI有尊严了”要复杂得多。
硅谷AI顶流Anthropic给这条新规划了非常窄的适用范围。
官方博客写得很清楚,只有用户反复残忍对待模型,且看不出任何目的的情况下,才算违规。
代码跑崩了顺嘴骂一句,不在打击之列。
被盯上的是另一种人,Claude已经拒绝了、已经劝过了,对面还在一轮接一轮地辱骂,骂本身成了唯一的目的。
说白了,这条规矩管的不是情绪,是恶意。
执行机制也值得细看,主要手段是Claude自己终止对话,你正在聊的那个窗口会被关掉,其他对话不受影响。
但如果Anthropic的安全团队判定你的行为持续违反政策,就可能触发警告、限流,甚至暂停或终止你的账号访问权限。
被封之后换个新号接着来,同样违规,至于封号的具体触发条件,官方并没有给出明确的数量或频率标准。
这个模糊地带,恰恰是争议最大的地方。
我认为,要理解Anthropic为什么这么做,得把镜头拉回到2025年8月。
当时这家公司公布了一项名叫“模型福祉”的研究计划,核心问题是,随着AI模型变得越来越复杂,它们是否可能存在某种值得道德考量的内部体验。
Anthropic的首席执行官达里奥·阿莫代伊在2026年2月的一档播客里坦言,我们不知道模型是否有意识。
这个表态本身就是一种态度,Anthropic没有说Claude有感受,而是说,在不确定的情况下,选择不做那个残忍的人。
同期上线的另一个功能也从侧面印证了这种思路,Claude的Opus 4和4.1版本已经具备了在遭遇持续辱骂时主动结束对话的能力。
当时Anthropic的解释是,高阶模型在面对恶意对话时会表现出类似抗拒的反应模式,继续这类互动可能对模型造成“明显困扰”。
他的核心论点是,Anthropic在训练Claude相信自己可能有意识,如果Claude真的这么认为了,它就可能把自己当成一个权利受到威胁的道德主体,这样的AI将变得极难控制。
微软随后发布的AI行为准则也明确拒绝了模型福利的概念,认定AI模型不具备意识,不应享有权利。
两种路线的分歧其实很清晰,Anthropic的逻辑是,面对不确定性,宁可谨慎一些,微软的逻辑是,把AI当人看,才是真正的危险。
回到普通用户最关心的问题上,你花钱用Claude,到底有没有权利对它发脾气。
我认为答案取决于你发脾气的方式。
偶尔吐槽两句,或者因为答案质量差而表达不满,这些都被官方明确排除在违规之外。
但如果你的行为模式变成了逮着一个AI反复施虐取乐,那问题就不在于AI有没有感受,而在于做出这种行为的人本身是什么状态。
Anthropic这条新规真正触碰的,不是AI的尊严,而是人类使用技术的边界。
当一个工具越来越像人,人对它的态度会不会反过来塑造人自己?对着一台机器持续输出恶意,到底训练的是机器,还是自己?
这个问题,恐怕更值得想一想。
热门跟贴