Anthropic计划为未来的Claude模型配备文本水印机制,使拥有适当密钥的人员能够估算Claude参与生成文本的可能性。公司在2026年8月14日的一篇文章中说明,该水印对读者不可见,不会添加隐藏字符或元数据,也不需要额外令牌或提高模型运行成本。
此举是Anthropic遵守欧盟《人工智能法案》的一部分。2026年7月,该公司与其他主要模型提供商以及总计约190家签署方共同签署了欧洲关于人工智能生成内容透明度的实践准则。据Anthropic称,自8月2日起,欧盟要求服务其市场的人工智能提供商为机器生成的内容添加标识。
水印如何运作?
语言模型逐词生成文本,并在每一步从多个可能的词语中进行选择。当多个选项在含义和质量上都较为接近时,水印机制会使用一个密钥和一组此前的词语,来确定决定选择的随机性来源。因此,选择在实际表现上仍然是随机的,但词语序列会留下一个模式,日后可以使用该密钥将其检测出来。
Anthropic表示,这一机制不会促使Claude选择它通常不会使用的词语,也不会使其始终偏向某个特定词语。公司将其比作使用圆周率中的数字序列而不是掷骰子:结果看起来是随机的,但分析结果序列可能会揭示随机性的来源。
对文本质量几乎没有实际影响
根据内部测试,Anthropic没有发现Claude文本的内容、创意性或可读性受到影响。公司还提到SynthID-Text研究,该研究在Gemini部分流量上测试了这项技术,没有发现带水印文本与未带水印文本的评分之间存在具有统计显著性的差异。在一项受控研究中,人工评估者在并排比较答案时无法察觉质量差异。
公司强调,水印只会使模型略微变慢,也不会使服务成本更高,因为它不会生成额外令牌。水印还不包含可用于揭示用户、其所属机构或其对话身份的信息。
检测限制以及编辑和编程场景
检测效果取决于文本长度,以及模型在其中拥有多个合适选项的决策数量。因此,短文本样本的检测效果较弱;在只能给出一个准确答案的事实性段落中也是如此,例如说出艾萨克·牛顿作品的正确名称。轻度语言校对同样如此,因为大多数词语仍由用户撰写,水印没有足够的信息可供依托。
在编程中,当必须精确输出时通常不会应用水印,因为更改一个词或符号可能会破坏代码。不过,在存在任意选择的位置,例如代码注释中,水印可能会出现,而对代码本身的影响很小。Claude生成的翻译则会带有水印,因为模型选择了其中的所有词语。
可用性以及水印能够证明什么
Anthropic正在准备提供用于检测水印的应用程序编程接口,但尚未确定其实施细节。水印在发布时将在全球范围内应用,因为公司目前没有可持续地按地区限制水印的方法。公司还在努力将其添加到2026年8月2日之前发布的Claude模型中,利用欧洲法律规定的过渡期,预计将在未来几个月内完成。
水印并不能证明Claude完整撰写了文本;它只能表明Claude参与生成或处理该文本的可能性,也无法区分原创写作和大幅编辑。完全重写文本可能会移除水印,而轻度编辑可能不会将其移除。水印不会改变用户的权利、内容所有权或相关法律责任。
对于PNG、JPG和SVG等受支持的文件,Claude将根据开放的C2PA标准,在文件元数据中以加密签名备注的形式添加内容凭证。Anthropic表示,这些数据不会改变文件,也不包含身份识别信息,并且可以由兼容C2PA的工具读取。