Claude 文本水印怎么工作,又管不住谁
8 月 14 日,Anthropic 发了公告,Claude 生成的文本以后会带一层看不见的水印。官方说明不长,我翻了两遍,把原理、防谁,防不住谁捋成了下面这几段。

水印藏在选词里
大模型说话是逐词往外蹦的,每蹦一个词,都相当于做了一次选择题。比如“今天天气很”后面接“冷”还是“凉”,意思差不多,选哪个看模型心情。水印藏的就是这种不影响意思的选择空间。做法是把选词的随机数来源换掉,改由一把密钥加上前几个词来决定选哪个。手握密钥的人能验证这段话是不是 Claude 写的,读者全程无感。
官方打了个比方。大富翁走格子,本来靠掷骰子,现在改用圆周率 π 的数字当点数,从第 1012845 位往后取。玩家毫无察觉,但懂规则的人看一眼移动轨迹,就能判断这局是不是 π 在操盘。那个 1012845 我盯着看了一会儿才想通,就是随手挑的起点,没玄机。
目标:批量造假的人
官方点名了要防的对象。新闻站拿 AI 批量造假消息,政客团队拿 AI 起草舆论稿,自媒体把 AI 稿当原创卖,水印要标记的是这些。普通用户不在名单上。密钥在 Anthropic 手里,检测 API 也只向特定合作方开放。
反过来想也通。真想管个人用户,服务条款里添一行禁止商用就够了,犯不着在模型底层搭一套密码学方案。这更像供应链溯源,内容出厂那一刻,自带可验证的钢印。
水印盖不住的地方
事实性强的段落没得选。牛顿最著名的著作叫《自然哲学的数学》,下一格只能是“原理”,水印没地方藏。轻度校对算一种,只动了几个标点和语法,水印几乎无处附着。代码算一种,代码必须精确,能换的只有注释那点余地,拿 Claude 辅助写业务逻辑,基本带不上标。人工改写或翻译过的内容也算,改写会打乱原来的选词模式,翻译干脆把词全换了,拿密钥去验,命中率明显下滑。
原生整段的 AI 文本能验出来。改写过、翻译过的,还有人机混着的,只能给个概率。
检测工具走的是另一条路
Pangram 这种工具手里没有密钥,只能闻 AI 味,比如 AI 爱用某些固定句式,或者有些词出现得反常地勤。模式识别和密钥验证,原理上是两码事。前者误判率高,后者只认 Claude 自家的输出,各有盲区,谁也替不了谁。水印检测 API 官方说快推出了,细节还在敲。
普通用户不用管
对日常用 AI 工具的人来说,这事更多停在合规层面,体验上没什么变化。你要只是拿 Claude 当助手,草稿出来自己再过一遍手,不用操心。被顶到前面的,是拿 AI 内容当人写的搬运工,还有要批量识别 AI 内容的平台方。
欧盟 8 月 2 日起已经要求 AI 厂商给 AI 内容打标,Anthropic 签相关行为准则只是开头。往后要掰扯的问题恐怕是另一件:AI 写的东西,要不要先跟读者报备。
写这篇时我让 Claude 帮我校过一遍段落,它改了两个连接词。查资料查到这我自己先乐了:就这两下,水印八成已经验不出来了。