Hacker News 中文摘要

RSS订阅

AI文本水印的工作原理 -- How AI text watermarking works

文章摘要

AI文本水印技术通过模型在生成文字时对同义词的随机选择来嵌入隐藏标记,而非修改字符本身。这种标记肉眼不可见,能抵抗复制粘贴,已在Google Gemini和Claude等模型中得到应用。

文章总结

好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。


标题:AI文本水印的工作原理

在纯文本中添加水印看似不可能。文本没有像素来隐藏数据,复制粘贴后元数据也会丢失,每个字符都直接呈现在你面前。那么,水印究竟藏在哪里?

然而,水印是真实存在的。自2024年起,谷歌已为其Gemini应用和网页版输出添加水印。截至2026年8月,新的Claude模型也在模型层面添加了水印。这些水印不可见,能经受复制,其工作原理并非藏身于字符本身,而是存在于词语之间的选择中。

1. 写作是一系列微小的选择

模型在生成句子时,并非直接确定“下一个词”,而是像自动补全一样,有一个带有偏好的候选词列表。生成文本的过程,就像在几个同样合适的词之间掷骰子。一页文本包含数百个这样的分叉点,每个词都可能面临选择。在许多分叉点上,几个选项同样合适。这种“松弛度”就是水印的原材料。谁能在骰子落地的过程中施加影响,谁就能在不改变文本含义的前提下,在其中隐藏一种模式。

2. 密钥悄悄影响这些选择

密钥会秘密地将候选词列表分为“绿色”和“红色”两组,这种着色只有持有密钥的人才能重现。然后,模型选择词语的“骰子”会被轻微地偏向绿色词。这种操作很隐蔽,因为偏向很温和,红色词仍然可能被选中,只是概率稍低。而且,一个词的颜色并非固定不变,密钥会根据它前面的一小段词语来计算其颜色。因此,同一个候选词,在某个前缀后是绿色,在另一个前缀后可能就是红色。只有密钥持有者知道,在特定位置哪些词是绿色的。

(谷歌的SynthID和OpenAI的方案原理类似,只是实现方式不同:前者通过小型秘密锦标赛,后者则直接用密钥生成骰子结果。核心思想一致:水印存在于选择之中。)

3. 密钥持有者可以计数

检测水印时,检测器会使用密钥重新对文本中的每个词进行着色,并统计其中有多少个是绿色的。没有水印(或使用错误密钥)的文本,绿色词的比例大约为50%,就像抛硬币。而带有正确水印的文本,绿色词的比例会显著高于50%。检测器不阅读文本内容,也不判断其风格,只是进行简单的统计。

(实际生产环境中的水印偏向非常微弱,需要足够长的文本才能可靠检测。短文本很难判断。)

4. 编辑对水印的影响

水印存在于未被修改的原始词句序列中。编辑会破坏这些序列,从而擦除水印。每个词的颜色由其前面的一小段词语决定。因此,只有当这个词及其邻近的原始词语都完好无损时,这个位置才能作为有效证据。轻度或一次性的改写会稀释水印,而非完全删除。在实验中,即使是人工改写,在文本足够长(约600词)后也能被重新检测出来。真正能擦除水印的是基于语义的完全重写,因为这种重写不会保留任何与原文相同的词句序列。

(需要说明的是,这些数据来自可测量的公开实现。Anthropic的生产方案未公开,因此外界无法对Claude自己的水印进行此类测试。)

5. 实际意义

  • 只有密钥持有者才能检测。 老师、编辑或任何“AI检测器”网站都无法运行此测试。真正的检测需要AI提供商的密钥或其提供的检测服务。
  • 水印检测不是“AI检测器”。 像GPTZero这类工具是通过风格猜测,并不可靠。水印是相反的:一种有意的、基于密钥的统计测试。
  • 发现水印意味着“经AI处理过”,而非“由AI创作”。 即使是人类文本,如果经过Claude的校对或翻译,也会带上水印。而旧模型或经过大量编辑的AI文本,则可能检测不到水印。
  • 短文本和低选择性的文本(如代码、引文)携带的水印很少。 证据随文本长度增加而积累。
  • 某些水印能经受改写。 基于词语本身而非其邻居的水印,在语义改写后仍能部分存活。其弱点在于可能被反向工程。对于基于语义的水印,目前已知的唯一应对方法是进行大纲级别的重新生成。

来源与延伸阅读(已为您整理为中文列表):

  • Kirchenbauer 等人,《大型语言模型的水印》(ICML 2023)
  • Dathathri 等人,《用于识别LLM输出的可扩展水印》(SynthID-Text, Nature 2024)
  • Aaronson & Kirchner,《GPT输出的水印》(2022)
  • Kirchenbauer 等人,《论大型语言模型水印的可靠性》(ICLR 2024)
  • Sadasivan 等人,《AI生成的文本能被可靠检测吗?》(2023)
  • Zhao 等人,《标记褪色:自适应进化释义攻击》(ACL Findings 2026)
  • Anthropic,《Claude如何标记AI生成的内容》(帮助中心,2026年8月)
  • 我们自己的已知密钥实验:基于语义的重写使KGW/EXP检测降至随机水平(AUC 0.99 → ≈0.5);上下文无关的单字水印能部分存活(0.73–0.84);大纲级重新生成是应对语义空间水印的唯一已知方法。

评论总结

根据评论内容,主要观点和论据总结如下:

1. 水印技术的可行性与局限性 - 支持观点:水印可识别AI生成文本,但需大量输出才能破解密钥(oidar: "I wonder how much output text it would take to work out the key")。通过本地模型改写可清除水印(techjamie: "someone washes the text through a local model that rewords it, the markers are lost")。 - 质疑观点:开源模型或非水印提供商可绕过检测(gizmo686: "use a model from an AI provider that does not watermark")。水印依赖模型运行方式,不适用于开放权重模型(gizmo686: "watermark is not inherent to the model itself, but rather how the model is run")。

2. 对创造力的影响 - 水印通过强制选择特定词汇组(如A组vs B组)降低模型创造力,尤其在代码生成中更明显(lemoncookiechip: "the model will nudge each word towards group A vs group B, you're losing on creativity")。短文本检测困难,代码水印可能被规避(lemoncookiechip: "the shorter the body of text the harder it is to detect")。

3. 商业与法律影响 - 水印可能成为AI提供商的新收入来源(techjamie: "new revenue stream for providers")。未来法律纠纷中,水印可证明AI辅助创作(calif123: "fuel for legal battles over ownership/creation/invention")。程序员无法再声称自己编写了AI生成的代码(AProgramnerLazy: "a programmer can no longer claim that they wrote the code themselves")。

4. 用户应对策略 - 手动转录AI输出并改写可去除水印(throwatdem12311: "have a human reword/summarize and manually input/transcribe AI output")。高级工程师通过手写转录避免水印(guessmyname: "transcribe it by hand... replace words as I go")。

5. 监管与伦理争议 - 水印可能源于欧盟法规,但也被视为AI实验室的自身利益(lemoncookiechip: "naive enough to think Anthropic is doing this just because the EU said so")。用户级密钥可能被滥用(morkalork: "user-level secret keys... like those yellow dots printers add")。部分评论认为这是反乌托邦行为(noncoml: "Are they actively trying to create a dystopia?")。

6. 技术细节疑问 - 水印检测是否需要完整模型权重(storus: "Do you need to know the full conditional probability distributions")。在线文本概率计算因缺少上下文可能不准确(satellite2: "the probabilities be accurate?")。工具调用和CLI脚本的水印处理方式不明确(aleksiy123: "how does this work with tool calls or CLI scripts")。

平衡性总结:评论呈现两极分化——支持者认为水印有助于防止模型崩溃和提供检测服务;反对者指出其可被轻易绕过、损害创造力、并可能被用于垄断或监控。多数评论对水印的实际效果持怀疑态度,认为技术漏洞和商业动机将削弱其初衷。