近期,Anthropic 公司宣布了一项旨在提升 AI 生成内容透明度的重大举措。为了符合欧盟即将生效的《人工智能法案》中关于高风险 AI 系统内容标记的严格要求,Anthropic 决定在其旗舰大语言模型 Claude 中引入一种名为 SynthID 的隐形水印技术。然而,这一旨在追踪 AI 生成内容的尝试,在公布后不到几小时内便遭遇了开发者的“反制”。据 Wired 报道,不少程序员已经在技术社区中分享了绕过这些水印的方法。
所谓的“隐形水印”,实际上是一种对抗性技术。它并不改变 AI 输出的文本内容或肉眼可见的图像特征,而是通过修改图像的底层像素数据,或者调整文本生成的统计特征,嵌入一种人眼无法察觉的信号。这种技术旨在让算法能够识别出一段内容是由 AI 生成的,从而在检测到深度伪造或虚假信息时提供线索。Anthropic 声称,这种水印机制即使在经过截图、编辑、打印或重新生成等常见操作后依然有效,能够为内容溯源提供一种相对隐蔽的手段。
然而,科技圈的开发者们对此反应迅速。在 Anthropic 公布这一功能的短短几个小时后,Reddit 等技术论坛和社交媒体上就开始流传各种“破解”方案。最常见的绕过方法被称为“重采样”或“转储”。简单来说,由于 Claude 的输出机制是基于概率的,黑客可以通过将 AI 生成的文本再次输入给模型,或者通过特定的算法处理输出结果,破坏原本嵌入的统计水印特征。这种做法使得原本用于追踪的算法无法再识别出内容是由 Claude 生成的。
这一现象引发了科技媒体和行业观察家的广泛讨论。一方面,欧盟的法规要求企业必须能够区分 AI 生成的内容与人类创作的内容,以防止欺诈和误导;另一方面,开发者们担心,这种强制性的标记可能会被视为对用户隐私的侵犯,或者破坏了互联网内容的纯粹性。更有观点认为,随着绕过技术的公开,这种水印机制可能会迅速失效,导致监管机构面临“狼来了”的困境。
从更宏观的角度来看,这反映了当前 AI 安全领域“猫鼠游戏”的常态。随着 AI 生成能力的增强,检测和规避技术的竞赛也在不断加速。隐形水印作为溯源技术的一种尝试,虽然初衷是好的,但其技术脆弱性也暴露无遗。未来,如何在不侵犯用户隐私的前提下,建立可信的 AI 内容生态,将是科技公司和监管机构共同面临的长期挑战。
信息来源:Feed: Artificial Intelligence Latest,原文链接:https://www.wired.com/story/coders-say-they-already-found-workarounds-to-claudes-invisible-watermarks/
封面图片来源:Unsplash / 摄影师 Bernd 📷 Dittrich
