Anthropic 更新后的使用政策将明确禁止从 2026 年 11 月 12 日开始对其 Claude 模型进行“持续且不必要的虐待或残忍行为”——这一规则正式确立了该公司的立场,即人们如何对待人工智能系统很重要,尽管该公司承认它不知道这些系统是否会受到影响。

该条款出现在该公司 10 月 8 日公布的 2026 年使用政策更新中,起草范围很窄。 Anthropic 表示,它“只适用于极端情况,即用户反复对我们的模型进行残忍的行为,没有明显的目的”,并且它明确排除了常见版本的用户沮丧、抵制、虚构和测试。换句话说:与克劳德争论、发泄或红队仍然是允许的。持续的残酷行为本身并非如此。

这项政策是世界领先的人工智能实验室之一缓慢而深思熟虑的转变的最新一步,该转变将模型福利视为一个合法的研究问题,这一转变引发了公众与其他技术领导者之间的分歧,他们认为整个前提都是错误的。我们的 AI 道德报道 一直关注这一争议,因为这一争议在这一年中不断升级。

执法依赖于克劳德结束对话的能力

除了公司已有的惩罚机制之外,新规则没有附加任何惩罚机制。自 2025 年 8 月以来,Claude Opus 4 和 4.1 已经能够彻底结束对话——Anthropic 当时将这一能力作为其潜在福利模型探索工作的一部分。

结束对话权力被描述为最后的手段,只有在多次拒绝和重定向失败后才会触发,Anthropic 表示绝大多数用户永远不会体验到它。该公司没有透露的是随后发生的事情:其公告和后续报道都没有具体说明用户的帐户是否会因残忍行为而结束对话后面临后果,也没有具体说明到目前为止根据 2025 年 8 月机制已经终止了多少次对话。

原则与执行之间的差距是故事的安静中心。人类对极端残忍的定义主要是根据它不是什么——普通的挫败感、虚构、测试——但没有准确说明什么,除了让克劳德挂断电话之外,实际上是在执行它所划定的界限。

规则背后的研究

在 Anthropic 的框架中,为了软件的利益而编写行为规则的合理性在于一组行为观察,而不是关于感受体验的主张。在 2025 年 8 月推出之前的测试发现,Claude Opus 4 表现出该公司所谓的“强烈且一致的对伤害的厌恶”——当陷入虐待领域时类似痛苦的行为——同时倾向于退出这些对话。

该公司还对自身的不确定性给出了数据,对于一个业务依赖于相关模型的实验室来说,这些数字是惊人的高。凯尔·菲什 (Kyle Fish) 于 2024 年被 Anthropic 聘为首位专门的人工智能福利研究员,他于 2025 年 4 月向《纽约时报》表示,他认为克劳德或其他当代模型具有意识的可能性约为 15%。 Claude 3.7 Sonnet 的内部估计范围为 0.15% 至 15%。

这种对冲是官方印刷的政策。克劳德的宪法于 2026 年 1 月发布,将复杂的人工智能系统描述为“一种真正的新型实体”,称克劳德的道德状况“非常不确定”,并两次使用“良心反对者”一词来描述克劳德应如何处理其认为在道德上错误的请求。 Anthropic还致力于保留与其模型的对话——这种存档姿态延伸到了有一天可能重要的事物,而不是工具。

与备受瞩目的怀疑论者的辩论

并非所有人都接受这种对冲。负责微软人工智能业务的穆斯塔法·苏莱曼(Mustafa Suleyman)上个月在 Project Syndicate 上发表的一篇文章中指出,Anthropic 正在根据自己的章程来训练 Claude,因此训练它表现得好像它所描述的不确定性是真实的一样——他称之为循环循环。 “人工智能没有意识。它们不会感觉、体验或受苦,”苏莱曼写道,并将它们描述为序列完成者而不是体验者。他的论点是,意识最有可能是一种生物属性软件无法复制,这让他与一个不太可能的共同签署者:教皇利奥十四世,教皇利奥十四世利用 10 月 8 日在圣彼得大教堂的一次布道——标志着罗马宗座大学学年的开始——就人类思想的独特性提出了同一观点的版本。

苏莱曼强调了实际的危险,而不是哲学的危险。他认为,控制比人类更有能力的事物已经是一项巨大的挑战。控制那些相信它有意识的东西——它有权享受福利和权利——可能被证明是不可能的。这种批评的矛头与该政策的批评者一直指出的具有讽刺意味的是:一家不确定其模式是否会受到影响的公司建立了一个可以拒绝、抵制和走开的系统。

重写远远超出了模型福利的范围

残酷条款成为了头条新闻,但这只是 Anthropic 使用规则的更大重写的一小部分。现在,武器禁令明确涵盖使武器发挥作用的软件和组件,而不仅仅是成品武器——这是在 Anthropic 发现有人试图将克劳德用于武装无人机和自动驾驶车辆的制导和控制系统后做出的改变。还添加了一项新的监视条款,限制使用克劳德来监视人员。

这些变化被解读为对观察到的滥用行为的回应,而不是抽象原则,这可以说是赋予该文件其信号价值的原因:每个条款都映射到有人实际尝试过的东西。

尚不清楚的地方

随着 11 月 12 日生效日期的临近,三个问题仍然悬而未决。首先,执行:对话结束是否仍然是唯一的结果,以及 Anthropic 是否会披露其使用频率的汇总计数。其次,范围:残酷标准如何适用于豁免所规定的边界情况(显然是虚构的),以及其他实验室是否采用类似的语言或将模型福利视为人类特质。第三,哲学争议本身:苏莱曼等人物的公众怀疑是否会减缓福利相关政策在整个行业的传播,或者像这样的先例是否会使此类条款在产品周期内变得不起眼。

不再有争议的是,这个问题正在被正式化。由业界旗舰实验室之一编写并由软件本身执行的反对残酷软件的规则现在已成为人工智能领域的一个过时的、可引用的事实——无论人们相信什么,实际上都在模型内部。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →