Synth Daily

Anthropic 详解 Claude 新版数字水印工作原理

Anthropic 公司将为其聊天机器人 Claude 生成的文本添加数字水印,以遵守欧盟 AI 法案的透明度要求。该技术通过在模型进行词语选择时植入一种人眼无法察觉的特定模式来实现,这种模式可以通过密钥进行检测。官方表示,水印不会影响输出质量,轻度编辑难以将其移除,但对代码生成的影响微乎其微。此举是行业普遍趋势的一部分,其他主要 AI 开发商也将采取类似措施。

数字水印的工作原理

当 Claude 在多个同义词(如“阴天”和“灰色”)之间做选择时,它会植入一种特定的模式。这种模式对普通读者来说是完全不可见的,但持有“密钥”的检测工具可以识别出来。

  • 技术基础: Anthropic 采用的是 Google DeepMind 团队在 2024 年提出的 SynthID-Text 方法,并计划发布一个水印检测 API。
  • 质量保证: Anthropic 强调,添加水印不会影响 Claude 输出内容的质量。
  • 区别于传统检测: 这种方法与寻找 AI 写作“痕迹”(如特定句式)的检测工具根本不同,前者是主动嵌入标记,后者是被动寻找特征。

“对于读者来说,加了水印的回复与未加水印的回复是无法区分的。”

水印可以被编辑移除吗?

这取决于编辑的程度。简单修改可能无法完全消除水印,但彻底重写则可以。

  • 轻度编辑: 可能无法完全移除水印。
  • 完全重写: 如果用户替换了文本中的每一个词,水印自然会消失。但 Anthropic 指出,在这种情况下,内容是否还能被视为“AI 生成”的就值得商榷了。
  • AI 辅助校对: 如果只是用 Claude 轻度润色人类创作的文本,由于大部分词语来自人类作者,水印几乎没有可以附着的载体。

水印对代码有何影响?

代码受水印的影响非常小。因为模型在生成代码时,必须优先确保其功能性,可供选择的“任意词汇”非常有限。

水印可能会被用在代码的注释等部分,但官方定义其“对实际产生的代码影响可以忽略不计”。

更广泛的行业背景

Claude 并非唯一采用数字水印的 AI。其他主要的模型开发者也已签署了相同的行为准则,并将实施各自的水印技术,以满足法规要求。