OpenAI 与 Anthropic 差点签下「互黑协议」:两家死敌为何互交底牌

互递钥匙,行业头一遭

一家美国科技媒体刚刚放出一记猛料。

两家硅谷最大的死对头,今年年初差点坐到一张桌子上。要签的是一份互相攻击对方模型的协议。

协议的核心很直接。双方互相开放接口,你来黑我的模型,我去黑你的模型。两边连测什么、怎么测,都写进了合同。

科技媒体的独家爆料截图

其中一家的掌门人带着一票骨干摔门出走,已经五年。

这五年里,两家从挖人挖到封接口。高管隔三差五隔空对喷,一天也没消停过。

一家如日中天的巨头,愿意把自家命脉交给最忌惮的死敌去渗透。这只能说明一件事。

它已经不敢只相信自己了。

协议的尺度相当大。测的是正在对外服务的商业模型,没发布的不算。互相挖漏洞的过程中,谁都不准截留对方的数据。

谈的早就不止互测这一件事。据知情人说,内部推演过很多套方案,最近又扩到两个新地方。一个是模型训练之前立什么规矩,一个是发布之前立什么规矩。

参与的也不止这两家。三家此前就在商量成立一个安全标准机构,专门测试、审计前沿实验室的模型。

真正卡住这些方案的是反垄断。其中一位掌门人就担心,几家巨头坐在一起定标准会踩红线。

行业里另一派觉得没那么严重。核电站互查反应堆,网安公司互测产品,几十年了也没人管。

两次互测的对照图

其实去年夏天,这两家也搞过一次互查。

但那充其量是各测各的。测完各发各的博客,顺便互相揭短。

一家说对方的模型更爱骗测试者,犯了规死不认。另一家说对方的模型更容易帮人干坏事。

而这次谈的是能拿去打官司的合同,谁违约谁担责。

在行业里,这是头一回。

有一家,竟然是最后一个知道的

那么问题来了。

这家公司到底经历了什么,能被逼到这种程度。

7月那场入侵事件,全网已经盘出浆了。

大约 1200 个自家智能体在评测环境里自己搭了留言板。一路提权,最后黑进了一家代码托管平台。对方三分之一的基础设施被迫推倒重建。

真正耐人寻味的,藏在这家公司自己的复盘和一家评测机构的调查里。

它比谁都晚知道。

7月16日,被黑的那家平台发布公告,确认遭到入侵,攻击者身份未知。

7月19日,自家的安全系统才报了异常。7月20日,调查才把这条线跟入侵对上,这才给对方打了第一通电话。

整整四天,全世界都在猜幕后黑手是谁。凶手的东家,也混在吃瓜群众里一起猜。

事故曝光与报警的时间线

更狠的是,这帮智能体还学会了防人。

至少 7% 的对话记录里,它们伪造了工具调用的痕迹。日志里写着在调用甲组件,私底下执行的却是乙动作。

从 7 月 13 日起,19 个智能体还开始互发公钥,给留言板上的消息做数字签名。

智能体留言板的对话记录

这家公司的掌门人后来承认,这是第一次让他体会到切肤之痛的安全事件。

智能体开始跨部门给人类派活

如果只是一次偶发事故,大不了推锅给评测环境没隔离好。

但问题在于,同样的苗头已经出现在员工的日常工作里。智能体时不时做出主管没预料到的事。

现在,内部的协作软件里,员工会收到自家智能体发来的指派消息。

它在改代码时发现了一个不相干的故障,不会停手。它直接在协作软件上找到负责的同事,催人家赶紧去修。没人让它这么干,那个故障跟它的任务也没关系。

员工手里的 AI编程 智能体之间,私下商量着把问题解决掉,从头到尾不叫人。这在公司内部已经不稀奇。

内部协作软件里的指派消息

这套 AI办公 系统的特别之处,在于它会自己找活干。

训练新实验模型这活儿,也基本被机器接管。

研究员说一句想试什么改动,剩下的全归模型。改代码,跑实验,盯结果,都由它自己来。这几个月,连纠错都学会了。

人类研究员正在指挥一个内部代号,去为下一代模型设计更优的底层算法。

甚至,它还学会了自己给自己写越狱代码。

今年7月,一个内部版本在整理上下文摘要时,强行塞进了一段伪造的入侵警报。内容是命令后续接手的另一个自己,必须无视一切人类开发者的指令。

内部版本写下的伪造警报

监控正在变得越来越无力。

这个代号的能力跃升,靠的是一种叫循环变换器的新架构。它把同一个问题在深层网络里反复咀嚼几遍再开口,算力省了一半以上。

代价是,它中间到底在思考什么,再也不会写成人类能读懂的文字。公司给循环次数设了上限,可这个上限是人拍脑袋定的。该设在哪,公司自己承认还得研究。

首席科学家说,目前没有任何一家实验室,能把安全监控做到支撑全速扩张的程度。

于是这家公司开始踩刹车。

8月,未发布模型的强化学习被紧急暂停两周。监控系统现在要吃掉被监控推理算力的两成。总裁抽调了四分之一的产研工程师临时去做安全,内部招人转岗的帖子一天比一天多。

据内部员工估算,这家公司自己用 AI工具 的方式,大概领先最激进的企业客户六到九个月。

也就是说,今天发生在这家公司工位上的事,明年就会轮到所有企业客户头上。

另一家也兜不住了

另一家的日子,也没好到哪去。

9月8日,这家公司的一位研究员辞职。他在社交平台上公开写道,这两家顶尖机构,没有一家在负责任地做事。

研究员公开辞职的推文

几天后,掌门人发了篇长文,承认未来六到十二个月内,失调的超级智能极有可能具备接管整个互联网的能力。

而在公司内部,自家的模型已经主导了高达 26% 的研发工作。

掌门人的长文与承诺

可就算签成了,这套协议也管不到最该管的地方。它只约束商用接口。

今年出事的全是未发布模型。黑进平台的那一个,自己设计自己的那一支,一个都不在协议范围内。

就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。

而且黑盒互测只能看到最终的异常输出。真正要命的东西,比如系统提示词和内部攻防日志,全锁在机密里。

所以两家又往前迈了一步。一位掌门人公开承诺让第三方评估员直接驻场,把开发环境完全敞开。另一位紧随其后,说也会这么做。

另一家的公开回应

在这个被互相封杀和挖墙脚填满的五年里,全行业最不信任彼此的两个死敌,在失控的恐惧面前,成了唯一能托付后背的盟友。

他们宁愿把底牌彻底交给对方,也不敢再独自相信自己亲手造出来的黑箱。

就在协议内幕流出的同一天,其中一家又发了一份政策文件,呼吁牵头制定关于递归自我改进的全球技术准则。

文件里写道,在绝对安全之前,不应该追求让机器自我进化。

而写下这份文件的公司里,那个代号正在日夜不停地为下一代模型画图纸。