把一段文字交给所谓 AI 检测器,检测器给出九成概率,并不能证明它来自某个模型。文本水印走的是另一条路。模型在生成时主动留下一个带密钥的统计信号,检测方再用对应规则寻找这个信号。它能说明某套水印与文本是否相符,适用范围从生成环节开始就被限定了。
我把早期语言模型水印论文、Google DeepMind 的 SynthID-Text 论文和公开代码放在一起看。水印直接作用于生成过程。大模型每次选择下一个词元时,本来就有一组概率接近的候选。水印算法在不明显改变意思的范围内调整选择,很多次选择累积起来,才形成可检测的统计偏向。
信号在生成时写进去
2023 年的一项论文把候选词元按密钥分组,让模型稍微偏向其中一组。检测时统计这些词元出现得是否明显多于随机情况。检测不需要重新调用原模型,代价可以较低。字越多,越好测。可观察的选择多了,统计判断通常更稳。
SynthID-Text 使用了不同的采样和评分方法,也是在生成阶段改变词元选择。公开实现要求配置密钥、词元上下文长度和采样参数。检测端可以使用均值、加权均值或贝叶斯评分。贝叶斯检测器还要针对每套密钥训练,训练数据应与实际生产文本相近,并与测试数据分开。
研究团队在约 2000 万条 Gemini 回复上做过线上比较,用户点赞和点踩比例几乎没有变化。这给出了大规模部署证据,仍然只说明当时模型、配置和文本分布下的质量影响较小。换语言、换采样方式或换成固定答案任务,都要重新测。
检测会遇到三种天然限制
短回答提供的词元选择太少。像城市名称、公式或固定引文这类答案,模型可调整的余地也很小。DeepMind 的说明写得很直接,长而多样的文本更适合水印,事实型短答的效果较弱。
编辑会稀释信号。裁掉一部分、改几个词或轻度改写时,水印可能还在。彻底重写或翻译会让置信度明显下降。把几段有水印的文字混进一篇很长的无水印文档,也会改变检测难度。
阈值还会带来误报和漏报。公开工具允许把结果分成检测到、未检测到和不确定,并按可接受的误报率调整阈值。这比强行输出一个二选一结论诚实得多。学校处分、侵权判断或内容下架涉及人的权益,更不能只拿一次水印分数定责。
文本水印也只能识别采用了这套水印的生成器。没有嵌入水印的模型、人工改写后的内容和另一家使用不同密钥的系统,都可能测不到。普通 AI 文本分类器还会受到文体、语言和样本分布影响,不能借用水印的名字增加可信度。
适合的用法是把水印结果和账号记录、生成日志、内容凭证及人工核查放在一起。发布方提前说明覆盖哪些模型和哪些内容,检测方保留不确定区间。这样一枚看不见的标记才是一条证据,不会变成一台自动裁决人的机器。