在 Anthropic 开始在 Claude 的文本和图像输出上推出隐形水印几天后,该功能正产生批评者预测的那种摩擦:用户担心这些标记会暴露他们在工作或课堂上使用人工智能的行为,开发人员记录了水印在真实编码工作流程中的行为方式,以及承诺将其去除的工具市场虽小但可见。
Anthropic 表示,这一变化使 Claude 符合欧盟的《人工智能法案》,该法案的透明度规则在 2026 年 8 月 2 日之后对新模型生效。该法案第 50 条要求人工智能系统提供商使机器生成的输出“可以像人工生成一样被检测到”。 Anthropic 确认,全球(不仅是欧盟)提供的所有新模型都将从“第一天”标记人工智能生成的内容,并在 2026 年 12 月之前有一段宽限期,用于更新之前发布的模型。 更多相关背景,请参阅我们的AI行业报道。
标记本身是不可见的。根据 Anthropic 支持文章的说法,文本输出“带有嵌入的水印”,而生成的文件则包含格式支持的数字签名来源元数据。早期的克劳德模型也将更新为标记文本,这意味着整个机队最终将在其输出上标记。
水印涵盖已编辑的文本,而不仅仅是生成的文本
Ars Technica 于 8 月 13 日披露了将技术好奇心变成强烈反对的细节:水印适用于克劳德“处理”的内容,而不仅仅是它从头开始生成的内容。 Ars 将这种方法描述为“从轨道上对其进行核武器攻击”,因为 Anthropic 正在标记所有支持的已处理内容,尽管欧盟自己的指南并不要求在人工智能系统执行“标准编辑的辅助功能”(该法规的示例是语法校正)或不会“实质性改变”用户文本的情况下进行标记。
这种区别很重要,因为在模型级别应用的水印无法区分批量生成和逗号修复。 Ars Technica 的阿什利·贝兰格 (Ashley Belanger) 指出,克劳德最终可能会在法律所禁止的那种经过轻微修饰的人类文字上盖章。实际上,该标记会标记克劳德处理的任何内容,甚至是人类编写的、只要求克劳德润色的文档。
用户担心在工作和学校被抓到
用户反应很快。 TechCrunch 8 月 13 日报道称,一些 Claude 用户“对 Anthropic 的新水印让他们在工作、课堂上使用它感到愤怒”。悄悄依靠克劳德起草电子邮件、报告或幻灯片的员工以及在作业中使用它的学生现在面临着老板或讲师可以使用检测工具验证人工智能参与的可能性。
Ars Technica 将这种动态描述为“红字”——一种人工智能使用的隐形徽章,读者看不到,但机构很快就能看到。由于水印通过复制粘贴和格式更改随文本一起传播,因此“我只是稍微编辑了一下”的通常防御不再留下人工智能的指纹。
搬家市场已经出现
哪里有水印,哪里就有去除行业。 SC Media 报道称,在 Claude 更新后的几天里,人工智能水印去除工具的市场已经出现。 Decrypt 记录了开发者正在积极尝试打破标记方案,探索其在释义、翻译和重新格式化下的表现。
早期测试表明,该水印对于随意处理来说是坚固的,但在专业条件下会泄漏。 New Stack 的报道得出的结论是,该标记“可以在复制粘贴中幸存,但不能在真正的开发工作流程中保存”——这意味着在正常工程中大量修改人工智能建议的代码的软件开发人员可能会在无意中洗掉该标记。
标记实际上是如何运作的
declaude.org 上发布的一个广泛分享的视觉解释器打破了这一机制。文本没有可以隐藏数据的像素,也没有元数据可以在复制粘贴后保存下来,因此水印存在于“单词之间的选择”中。当模型写入时,它会重复地在几个同样合理的下一个单词中进行选择;秘密加密密钥悄悄地将这些选择偏向只有密钥持有者才能检测到的模式。
该技术可以追溯到 Kirchenbauer 等人的研究。从 2023 年开始,它将候选词分为“绿色”和“红色”列表,并使生成向绿色标记倾斜。谷歌的 SynthID 通过更微妙的路线到达了类似的目的地,并且自 2024 年以来谷歌已经对 Gemini 应用程序和网络体验中的文本添加了水印 - 其 API 一直是一个记录在案的例外情况。截至 2026 年 8 月,新的 Claude 模型将在模型级别标记文本,早期模型也将跟进。
怀疑论者称移除仍然微不足道
并非所有人都相信军备竞赛有利于人类。在一篇广为流传的文章中,工程师肖恩·戈德克 (Sean Goedecke) 认为,文本水印“删除起来总是微不足道”,因为文本是一种极度压缩的介质——任何足以在确定的删除后幸存下来的变化都是人类读者会注意到的变化。释义工具、翻译往返和故意改写都可能在不降低意义的情况下消除统计模式。
这场争论正在开发者社区中展开:两位独立的水印解释者跻身本周黑客新闻讨论最多的故事之列,他们之间吸引了数百个点的参与。
接下来会发生什么
Anthropic 表示,它最终将分享有关如何检测标记的详细信息(欧盟法规所需的技术支持),但在公共检测工具发布之前,外部各方无法验证标记的实际彻底程度。该公司还承认,水印将无法在不支持它们的“某些平台或功能”上运行。
由于旧模型面临 2026 年 12 月的合规截止日期,而竞争对手实验室正在观察用户是否会因为透明度而惩罚 Anthropic,接下来的几个月将测试该行业多年来一直回避的一个命题:人工智能提供商能否使其输出可追溯,而不会对依赖它的人造成毒害。
---
掌握AI最新动态获取最新的AI新闻、分析和突破——尽在一处。
阅读更多AI新闻 →