【CNMO科技消息】近日,Anthropic发布2026年版《使用政策》,新增一条针对辱骂AI模型的禁令:禁止用户持续、无谓地对模型实施辱骂或虐待行为。新政策将于11月12日正式生效。这是Anthropic一年一度的使用政策更新,也是其首次把针对模型本身的辱骂行为写进禁令。

Claude
打开网易新闻 查看精彩图片
Claude

新条目位于使用政策通用使用标准中"不得从事残忍、虐待或造成心理伤害的行为"一节末尾,对所有用户生效,包括Claude.ai和Claude Code的个人用户、调用API的开发者与企业、通过云厂商接入Claude的客户,以及使用Claude集成产品的终端用户。

打开网易新闻 查看精彩图片

官方说明,这条禁令只针对极端情况:用户反复残忍对待模型,且看不出任何目的。普通抱怨、与模型顶嘴、创作黑暗题材、对模型开展测试和研究均不在禁止范围。被划入违规的,是模型已经拒绝、劝导之后仍一轮接一轮辱骂,骂本身成为目的的那类行为。

打开网易新闻 查看精彩图片

执行分两档。第一档由Claude当场结束对话,官方博客明确,这仍是执行该禁令的主要手段,这项能力已部署到Claude.ai和Claude Code。第二档是账号处置:Anthropic在政策中写明,安全团队会进行检测和监控,只要怀疑用户违反政策,即可对其警告、限流、限制使用,直至暂停或终止访问。被封后另开新号、借用他人账号规避处罚,同样属于违规。

本次更新还收紧了多处规则。新版政策新设欺骗行为章节,整合操纵虚假账号、水军网络的相关条款;明确武器禁令涵盖武器制导与控制软件、无人机武装改装;监视章节改写后点名未经同意的实时追踪与历史数据分析;高风险场景在原有"人工复核"要求之外,首次为接入可自主执行物理动作硬件的模型列出安全条件。

据Anthropic官方数据,2026年上半年该公司封禁了1140万个账号,收到39.8万次申诉,最终恢复的约4.2万个。