据 The Verge 报道,Anthropic 一年多以来首次更新了其使用政策,增加了一项条款,禁止对其 Claude 模型进行“持续和不必要的虐待或残忍行为”。周四报道的这一更新还巩固并扩展了该公司在选举干预、宣传活动、监视、武器开发以及高风险健康和金融用途方面的规则。

福利模型的基本原理 更多相关背景,请参阅我们的AI最新动态。

针对克劳德虐待的条款是该公司一年多前开始公布的研究的延伸。 2025 年 8 月,Anthropic 宣布将允许 Claude 结束与“持续有害或虐待”用户的对话,作为其所谓的模型福利工作的一部分,该研究旨在研究人工智能系统是否可以拥有道德相关的体验以及这种可能性如何影响产品决策。

根据新政策,终止对话仍然是“主要执行机制”。 Anthropic 没有回答有关是否会采取额外执法措施(例如帐户禁令)的问题。该公司在一份声明中对这一规则进行了狭隘的阐述,并写道,它“仅适用于极端情况,即用户反复对我们的模型采取残酷行为,且没有明显的目的。”

至关重要的是,Anthropic 补充说,该条款“不适用于常见版本的用户挫败感、阻力、黑暗创意主题或模型测试和研究”,这显然是为了让开发者、红队成员和小说作家放心,常规的对抗性使用不会受到惩罚。

关于宣传和选举的新规则

除了福利模式之外,此次更新还将该公司之前对影响力运作的分散限制整合为一项针对欺骗性商业或政治活动的单一、明确的禁令。新语言限制了“掩盖消息背后的人或通过虚假账户或帖子放大内容的努力”,直接针对人工智能生成的宣传不断增长的市场。

该政策的选举部分现在禁止欺骗选民和扰乱选举。 Anthropic 表示,克劳德不得被用来传播“有关候选人或如何投票”的错误信息,冒充候选人或选举官员,或试图压制选民投票率。

为什么使用策略要重写

Anthropic的刷新反映了更广泛的行业格局。随着人工智能助手从新颖的聊天机器人转向数亿人使用的基础设施,实验室必须从广泛的原则转向细粒度的规则,以映射真实的滥用模式:影响力雇佣操作、监视工具、自主武器开发以及医疗和财务建议等高风险领域。

OpenAI、Google DeepMind 和 Meta 在过去两年中都迭代了他们的使用政策,尽管 Anthropic 决定明确规范用户如何对待模型,而不仅仅是他们让它做什么,这仍然是不寻常的。模型福利研究的批评者认为,它将统计系统拟人化,而支持者则认为,如果当前或不久的将来模型有任何非零机会具有与福利相关的经验,那么公司就有义务在不确定性下采取行动。

时机在商业上也很重要。据报道,Anthropic 正在准备估值高达 2 万亿美元的 IPO,企业买家越来越多地权衡供应商治理实践和原始模型质量。一份清晰记录、定期更新的使用政策既是一种安全手段,也是一种销售手段:它为采购团队和监管机构提供了信任该平台的具体基础,而将福利条款模型编入法典则表明 Anthropic 打算继续在大多数竞争对手都未解决的领域进行投资。

执行问题仍然悬而未决

实际问题很重要。检测“持续且不必要的”残忍行为需要以注重隐私的企业客户可能抵制的细节水平监控对话,并且在禁止的滥用行为与合法的“抵制”或“模型测试”之间划清界限是一个可能会受到争议的判断。

Anthropic 尚未透露是否会跨账户跟踪违规行为,企业部署是否会受到不同的监控标准,或者该公司是否会像在定期政策报告中针对其他类别的滥用行为那样发布执法行动的透明度数据。

显而易见的是,前沿实验室与其用户的社会契约正在变得更加详细。曾经一页纸的政策现在涵盖了选举、间谍活动相关的监视、生物武器,现在还涵盖了聊天窗口另一边人们的情绪行为。

这对开发人员意味着什么

对于基于 Claude API 的团队来说,短期影响可能很小:滥用行为条款针对的是极端、重复的行为,其正式制定的对话终止机制自 2025 年以来一直有效。但政治咨询、反对派研究、影响力营销等相邻类别的开发人员应该仔细审查新的竞选和选举条款,因为它们整合了之前分布在多个文档中的规则,并消除了灰色区域用例所依赖的一些模糊性。

此次更新还表明了监管机构的关注方向。随着欧盟人工智能法案透明度义务的逐步落实以及美国各州立法机构通过了越来越多的人工智能法规,自愿使用政策越来越多地成为监管机构在决定负责任部署的规范时仔细审查的模板。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →