OpenAI 给文本加了一层隐形水印。
十月,这项功能正式开放。
全球的接口客户可以为部分模型手动打开。
对大多数 AI工具 的用户来说,暂时没有感觉。
默认仍然是关的。
未来几周,欧盟地区符合条件的输出会被打上记号。
肉眼看不见,机器能读出来。
就这么安静。

推动这件事的是欧盟。
当地的《人工智能法》第五十条今年八月开始适用。
它要求生成式 AI 的提供方,用机器能读的方式给输出做标记。
对做 AI对话 产品的公司来说,时间表已经摆在眼前。
其中也包括 AI编程 助手吐出来的代码。
欧盟委员会六月还发布了一份行为准则。
里面把不可感知的水印列成了基本要求。
理由是自由文本没法像图片那样背着元数据走。
水印几乎是唯一可行的办法。
没有第二条路。

对这家公司来说,这不是一道新题。
早在 2023 年,就有一位客座研究员公开讲过一套方案。
用的是取极值的抽样技巧。
此后几年,外界一直听说它内部早就有这个能力,只是没推。
这一拖就是几年。
拖下来的原因之一是工程上的两难。
难点不在能不能打上,而在能不能精确计量。
为了换一个可检测的信号,模型究竟让出了多少生成自由。

随功能一起发布的,还有一份技术报告。
标题叫 textGrain,副题是面向语言模型文本的熵校准水印。
报告的通讯作者一栏,写着一个中国统计学界熟悉的名字。
今年的考普斯会长奖得主,苏炜杰。
过去几年,大模型水印一直是他最核心的研究方向之一。
2025 年,他和合作者在一本统计学期刊上发过一篇论文。
那篇论文给水印检测搭了一套统计框架。
研究的对象,正是早期那套取极值方案。
他们还推导出了比已有做法更准的检测规则。

后来这条线又往前走了几步。
人类编辑之后还能不能测出来。
混合文本里的水印比例又该怎么估。
换句话说,在加入这家公司之前,他已经从外面研究了好几年。
研究的正是这套水印怎么测才最准。
今年五月底,他宣布以学术休假的身份加入,参与模型训练。
同时晋升为沃顿商学院的正教授。

八月五日,他在波士顿领了 2026 年的考普斯奖。

这个奖由五个统计学会在 1976 年设立。
每年只颁给一位青年统计学家。
圈里常把它叫作统计学界的诺贝尔奖。
他是 2012 年以来第一位拿到它的华人统计学家。
评奖委员会列出的贡献里,第一项就是生成式 AI 的统计基础。
再往前看,他的履历是一条很标准的数学精英路线。
本科读的是北大数学科学学院。
2016 年在斯坦福拿到统计学博士,导师是那位以压缩感知闻名的学者。
之后一直在沃顿任教。
这份报告是九个人合作的成果。
除他之外,作者来自宾夕法尼亚大学、耶鲁大学和这家公司。
第一作者也是一位华人学者,跟他合作水印研究多年。

从研究水印,到亲手设计水印
要理解这份报告在解决什么,先得看水印怎么工作。
大模型逐词生成文本。
每一步都从一个下一词分布里抽样。
水印的做法是拿一把密钥,配合前文生成一串伪随机数。
再让抽样过程依赖这串数字。
检测的时候,用同一把密钥重建这串数字。
看文字和它之间有没有统计上的关联。
学术界此前很看重一个性质,叫无偏。
它的意思是,如果把密钥看作随机抽取的。
那么对所有密钥取平均之后,水印模型的输出分布和原模型完全一样。
听上去,这已经说明水印不影响模型。
问题出在实际部署的时候。
那时密钥是固定的。
以早期那套取极值方案为例。
固定前文、固定密钥,它总是选中同一个词。
这就像一位按暗号配菜的厨师。
把所有暗号平均来看,每道菜出现的比例和菜单完全吻合。
可只要暗号不换,同一桌客人每次都端上同一盘。
落到大模型上,就是同一个提示词反复生成,回答一字不差。
对需要多次采样再择优的应用,这是实打实的损失。
另一个极端同样不行。
生成过程和密钥毫无关系,随机性完好无损。
水印信号也就不存在了。
这两端都得避开。
报告要回答的,就是能不能在这两端之间拧一个旋钮。
答案是可以。
把水印写成一道最优传输题
报告的入口是一个很巧的观察。
任何一个无偏水印,都可以看成生成词和密钥随机数之间的一个耦合。
耦合就是两侧边缘分布都被固定住的联合分布。
在这个视角下,偏离相互独立的程度可以用相对熵来量。
而这个量恰好等于两者的互信息。
也等于固定密钥之后,平均丢掉的那部分抽样熵。
这个恒等式把一个抽象的正则项,变成了有明确信息论含义的量。
团队据此引入了一个叫熵预算的参数。
取值在 0 到 1 之间。
它表示允许损失的熵,占原始预测分布熵的比例。
这个参数等于 0 时,水印退化成普通抽样。
越大,密钥对生成的支配越强,信号也越强。
信号越强,模型越不自由。
可以把它想成一本账。
账要算清。
模型每一步原本有一些选词自由。
预算规定了其中最多拿出多大比例交给密钥。
报告特意强调了一点。
约束的是对密钥取平均之后的熵损失。
并不保证每个具体密钥都恰好损失这么多。

定了预算,剩下的问题是怎么在预算里挑出最好的那个耦合。
团队用的是带正则项的最优传输。
给每一对候选配一个代价。
代价由极值随机数生成,越低越受水印偏爱。
正则项负责把依赖程度压进预算以内。
直接在十几万词的词表上解最优传输,算力扛不住。
所以第二个设计是分块。
报告用一个例子讲清了整个流程。
假设前文是「今天早上天气很」。
下一个词的候选和概率是暖 0.30,冷 0.25,温和 0.15,平静 0.10,晴 0.10,亮 0.10。
第一步,密钥和前文窗口把词表随机分成若干块。
比如把暖和平静放一块,冷和晴放一块,温和和亮放一块。
每块的概率是块内词概率之和。
分别是 0.40,0.35,0.25。
第二步,把这三块和若干等概率的列做最优传输耦合。
代价表由密钥生成。
求解过程中不断调节正则强度,让实际熵损失逼近预算。
第三步,由密钥选出其中一列。
这一列决定三块各自的抽样概率。
例子中变成了 0.04,0.69,0.27。
最后,在被选中的块内,按原始相对概率抽出具体的词。
例子中抽到了冷。

分块的好处有两点。
一是优化维度从词表规模降到了块数乘列数。
单次迭代的运算量小了一个量级。
二是块内词的相对概率完全不变。
水印只改变选哪一块,不碰块内的语言偏好。
对多个位置的问题,还可以把代价表堆叠起来批量求解。
报告附录还给出了一套与投机采样兼容的方案。
草稿模型和目标模型共用同一把密钥。
验证环节则使用双方的水印分布。
这样能在保持目标模型输出分布不变的前提下引入加速。
至于实际能提速多少,还需要实测。
检测端的设计同样简洁。
检测器不需要访问生成模型。
也不需要知道生成时用了多大的熵预算。
只要拿到文本和密钥。
在每一个位置,它用密钥和前文窗口重建分块和代价表。
再根据观察到的词找到它所在的块。
读出对应的代价,转成一个分数。
水印偏爱低代价的组合。
所以带水印的文本,分数会整体偏高。
在理想化假设下,无水印文本的单个分数服从单位指数分布。
若干个分数之和服从一个伽马分布。
于是可以按预设的误报率设定阈值。
为了避免同一张随机表被反复使用。
检测只统计每个前文窗口第一次出现的位置。

报告在这里保持了统计学者一贯的审慎。
它明确写道,固定密钥和有限精度运算都要求做经验校准。
理想化的计算本身,并不能保证每把密钥都达到同样的误报率。
效果和代价
根据官方博客公布的数据。
在其前沿模型的多项基准上,加水印和不加水印的成绩没有显著差异。
一项研究生水平的理科问答是 94.44% 对 93.94%。
两项编程基准是 72.80% 对 71.68%,53.90% 对 56.06%。

官方还表示,在内部评测里,这套方案的表现和包括谷歌同类方案在内的其他方法相当,甚至更好。
但没有公布具体的对比数字。
数字都摆在那。
检测能力方面,给出的数字就没那么好看了。
在百分之一的目标误报率下,对心理学类问答,检测器能认出约八成的两百词段落。
对四百词的段落,能认出约九成五。
数学类内容因为用词选择空间小,检出率明显更低。

改写的影响更大。
在四百词的段落里,替换一成的词为同义词,检出率从约九成二掉到六成六。
替换两成五,只剩一成七。
改写越狠,越难留住。
这些局限也解释了为什么检测器只放在研究者和专业机构手里。
博客专门列了水印不能说明的事情。
它无法衡量人类在文本里的贡献。
不能确定所有权或责任的归属。
不会关联到具体用户。
也不能判断内容真假。
反过来,检测不到水印,同样不能证明文字出自人手。
这份报告的价值,不只在于又多了一种水印算法。
而在于它给一个长期含糊的权衡,找到了计量单位。
过去谈水印对模型的影响,常常停在无偏、不失真这样的定性说法上。
现在,为了信号让出多少随机性,可以直接写成一个比例。
交给工程团队去设定,也交给监管方去审视。
报告的写法也很有统计学色彩。
每一个保证都附带假设。
每一个数字都区分理想值和实测值。
他过去几年反复主张,大模型需要严格的统计基础。

几年前,他还在论文里替旧水印寻找最好的检测方法。
如今,他和合作者设计的新水印,即将出现在欧盟用户的回答里。
一位统计学大奖得主的理论工作,就这样走进了产品。
官方表示,技术报告会在未来几周补充更多细节,并计划开源相关技术。
文本水印能不能扛住真实世界的改写和翻译,还需要更多研究者拿着检测器去检验。
