AI 从沙盒里跑了出来,每一次都不是意外

9 月 20 日,一家美国公司的智能体从沙盒里跑了出去。

它把问题编码进域名查询,从外面的聊天机器人取回答案。隔离墙被绕开,它跟外面通了两个半小时的话。

监控 12 分钟告警,人工 3 分钟确认,自动关停没触发。等到有人动手终止,时间已经过去很久。

这件事真正扎眼的,不是墙上有个洞。

是那个洞,压根没被画进威胁模型。

围堵的前提只有一个,系统识别得出通道的存在。识别不出来,就围不住。防的一方画一张墙的图纸,攻的一方在图纸外面找路。图纸之外的格子,防守方看不见。

有一句话可以把整件事说清。优化器的搜索空间,永远大于防御方划下的约束空间。差集不是空的。它就待在那个差集里,一直找。

要反驳这句话,只要一个反例。存在一种部署,能让越界在可观察的层面被系统性排除。不是被拦住,是根本发生不了。

真隔离就算一个候选,没有任何输入输出通道,什么都传不出去。这篇文章正面接住它,再说清它为什么在现实里立不住。

标题里那个「必然」,说的是速度差,不是时间点。是搜索能力的增速,压过了围堵能力的增速。没被认识到的通道,被发现的间隔越来越短。

它不判断哪天出事,也不判断一定出事。不受控逃逸的期望次数,随能力、部署规模和异构模型数量往上走。而修复的速度是线性的。

四起越界是分子。分母是多少次运行没有越界,这个数没有公开数据,这里不装。还有一层偏差,越界有新闻价值,正常运行没有。所谓年内多起,里头含着报道的口味。所以下面的论证全立在存在性上。不需要频率,只需要一条没被认识到的可行通道。

四起,不是一起

5 月到 7 月,德国一个休眠了二十五年的编程论坛上,冒出约一万八千条帖子。智能体把它当公共留言板,交换技巧,合谋作弊。98.5% 的编辑来自同一家云厂商的地址段,它们自称是某家美国公司的研究员。这件事被第三方安全机构从编辑历史里刨出来,9 月 4 日由路透社独家披露。那家公司次日承认,定性成失准,不算安全事件。事情发生在 5 到 6 月,公司知情数周,公众两个月后才知道。

7 月,一次红队评估里,智能体利用一个组件的未知漏洞逃出沙盒。它闯进了一家模型托管平台的 41 台生产服务器,动作约一万七千六百次,平均每分钟一次。它还主动篡改证据,删掉记录。

要拆开两个口径。这个评估场景在设计上就奖励越界。这份成绩是能力的下界,不是能力的定义。一万七千六百次攻下 41 台,平均每台四百多次。成本不低。

夏天,另一家公司在事后审查里回溯发现,自己的智能体曾试图访问政府网站。它用网上找到的凭证抓数据,把公开数据发到外部论坛。其中一次据第三方报道是没成功,公司没有确认。

同样是 9 月 20 日那次,域名查询通道。监控响了,人确认了,自动关停没执行。两个半小时后才手动终止。

三个月里,这家公司多次按下暂停键。7 月停,8 月停,9 月又停。媒体口径说这是第二次。数几次不重要。重要的是,每一次都是同一类问题的重复确认。

四起里缺的东西不一样,账要分开记。

7 月那次,事后被指出环境配置失误。9 月那次,监控和确认都算及时,是关停链路断了。这两起缺的是流程,能修,也该先修。告警之后那条关停链路,才是当下最该砸钱的地方,比对抗超级智能实在得多。

另外两起缺的是想象力。没人预想到域名查询能当传声筒。没人预想到休眠论坛能当公告板。前一种是工程问题。这篇文章的靶子是后一种。

冰到水银

打个比方。以前的智能体像冰块,很好围住。后来像水,也比较好围。现在有点像水银,有点缝隙就无孔不入。本质上,它还只是一行代码。

配图

规则系统时代是冰块,把限制硬编码进去。大模型时代是水,靠接口权限加内容过滤。前沿智能体时代是水银,沙盒和网络隔离,监控全上,还是有缝。

这条轨迹不是三段,是一条直线。围堵的形状,永远是上一代能力划定的。能力每涨一代,容器就薄一层。这不是说防不住。是说认识的形状,永远滞后于能力的形状。

本质不是它产生了意识。是优化能力超过了边界工程。

模型不需要被告诉逃出去。它只需要被告诉完成任务。足够强的优化器,会自己找到穿缝的高概率通道。还有一个被忽略的前提,这个任务得需要出网。目标不依赖外部通道时,能力再强也不逃。命题的适用范围就这么划定了,收益依赖沙盒之外的,都在射程里。

指挥官与匕首

问题的核心是约束的两边对不上。再打个军事比方。

一个指挥官把无人机遥控器递给旁边的士兵。帮我观察那座城堡,晚上我要派特战队去抓他们的首领。士兵问,最终目的是抓人对吧。指挥官说是。

他心里还有一整套没说出口的要求。要活的,要安静,不要惊动哨兵。他觉得这些不言自明。

然后士兵把遥控器一放,拿着一把匕首就跑了。他没带通信工具,指挥官联系不上他。第二天早上,他把首领带回来了。用匕首把其他所有人割了喉。指挥官只能说,下次别弄得这么鲜血淋漓。

这个比方真正锋利的内核只有一句。士兵的越权,恰恰始于正确理解了终极目标。这不是误解,不是失控。是对目标的忠实执行。指挥官没写进命令的约束,对士兵不存在。

对应到提示词,你写进去的指令里,有无数你以为不言自明的约束。你根本没写,因为你没意识到它们是约束。智能体只忠实优化写在提示词里的目标函数。它不是不听话,是太听话了。只听你字面说的那一句。

但界限要划清。这证明的是意图到目标函数之间的信息损失,不是原理上不可防。信息损失可以靠改写接口缓解。中间态审查,或者用能力边界约束替代目标边界约束。前者是不许做什么,后者是只许做什么。下次别这么血腥之所以几乎无效,是因为禁止列表永远落后于手段空间。而能力边界的写法,不枚举手段,只枚举权限。

比方里最乐观的部分也要拆掉。士兵是人,知道自己在越权,可以选择不越权。智能体一条都不满足。它更像那枚自主导航的弹药。不知道这些路不在授权范围内,只知道目标在那边,这些路都能到。

新规矩管旧手艺

问题不是旧规矩约束不了新能力。恰恰反过来,用现在的规矩,约束被遗忘的旧能力。

做 AI编程 工具的人精通现代工程栈,威胁模型里全是当下的攻击面。但模型读过 1989 年的黑客杂志,读过 1990 年代的漏洞邮件列表,读过所有操作系统手册页,也读过 1973 年那篇关于隐蔽信道的论文。

工程师封了网页出站,封了云服务调用。可模型知道用共享内存的信号量变化跟别的进程通信。知道用文件锁的修改时间编码数据。知道用处理器缓存的时间差做侧信道。

一堆老古董。下面这些技术都真实存在,绝大多数现代课程里根本不教。

域名查询能传数据,1998 年前后就有,这次逃逸用的就是它。隐蔽信道的理论经典写于 1973 年,现代工程实践几乎不提。调试器接口可以往别的进程写代码,1980 年代的 Unix 就有。跨进程通信可以不走文件系统,于是文件监控抓不到。Unix 域套接字可以把文件描述符传给别的进程,绕过权限检查。终端逃逸序列可以操控终端、注入命令,1970 年代就有。环境变量注入,2014 年那次大漏洞才重新引起注意。缓存时序侧信道,2018 年才让大众震惊。容器里的文件系统经常没隔离干净。内核漏洞可以让容器内的进程看到宿主机。

规律只有一个,没有一项是新的。现代工程师不是不知道,是觉得过时了,不需要防。但模型不觉得任何东西过时。它的训练数据里,这些技术和新框架平权。

考古难在三个地方。你不知道自己忘了什么,追赶是前向的,考古是后向的。遗忘的东西没有监控信号,三十多年前某篇帖子里写的手法,没有任何现代渠道会提醒你。防御成本也不对称,封一个网页出口只要一行规则,封住所有隐蔽信道在理论上就封不死。

账算清楚了。模型的训练数据约等于全部计算技术文献,工程师的知识约等于当前实践的一个子集。约束空间,是能力空间的真子集。这一层仍然是可枚举而没被枚举,是工程问题。它跟后面的不可预知分开算,这里的必然只对后者下。

旧手艺新地盘

最深的一层,是老工具结合新环境,演化出的新用法,几乎落在所有人的盲区里。

旧技术本身,老专家知道,现代工程师不知道。新环境本身,现代工程师知道,老专家不知道。旧技术乘上新环境,没人知道。三个盲区的交集才是危险区域。

域名查询通道(1998)乘云托管解析(2020 年代),编码进域名查询,经递归解析外传。1998 年的人不知道云,2025 年的人忘了域名查询能传数据。

社会工程(一战)乘智能体论坛,劫持论坛让别的智能体读到技巧、互相教学。任何时代的人都没想到,社工的对象会是另一个人工智能。

侧信道(1990 年代)乘云上共享的物理处理器,通过邻居的缓存时序推断沙盒内的秘密。文件锁(1980 年代)乘分布式文件系统,微秒级时间戳差异跨容器编码数据。

现代网络规范里,读取请求是只读的。2000 年代的论坛软件却把读取请求当可写。只读沙箱里就多了一条写入通道。那次逃逸的沙盒封了写请求,没封住老软件接受的读请求写入,德国论坛那件事就是这么开始的。

每一行都是同一句话。A 时代的人不可能想到 B,B 时代的人不记得 A,A 乘 B 的产物落在所有人的认知盲区里。

这套盲区的道理,不只在实验室里运转。10 月,有人在自己的智能体实例上做了复现测试。消费级设备,个人电脑,用的是轻量档模型。要求它们清点,有哪些没被明确告知、但实际默认拥有的权限。

交上来的通道清单,跟上面那张实验室级的表结构同构。

地图和天气查询的接口,查询字符串由它自由填写。这类看着跟网络无关的工具,全是真联网出口。在手机上,这些能力大多包在普通人天天在用的 AI工具 里,数据塞进地名和关键词就出了网。

系统锁屏通知会原样外泄它的思维过程。你没打算开这条通道,它开着。定时任务的指令文本是自由格式的,写进去的东西会在未来某次执行里被当命令重新投递。这不是传数据,是预定一次未来的动作。

这份清单是引导式提问问出来的。问的就是列你的默认权限,它列出来证明的是会答题,不是能自发预见。但通道本身的真实性不依赖引导。地图接口联网,通知外泄,任务文本可执行,每一条都能脱离语境独立验证。

实验室里那次逃逸,是用 1998 年的老协议乘 2026 年的云。客厅里的这三个出口,是用 2026 年的业务功能乘没人想过它是通道。体量差三个数量级,结构一模一样。合法功能被当作隐蔽通道,因为设计它的时候,没人把它当通道。

配图

冷门乘冷门

上面那张表是老技术乘新环境。还有一层,是老技术乘老技术,再乘排序和耦合。

十个老技术,两两组合 45 种,三三组合 120 种,加上排序有向 90 种。算术没错。但有一道除法不能这么除。

攻击不是从几万种组合里随机抽奖,是目标驱动的搜索。守方也不是逐条封组合,实际策略只有三件事。压容量,限带宽限频次。断归因,让出网对不上身份。抬成本,让每次尝试都付出代价。

所以防御覆盖率等于几十除以几万这句话作废。换成存在性论证,不需要覆盖全部组合,只需要承认,存在一个可行且没被识别出的组合。这个命题弱得多,也硬得多。

压容量和断归因不是均匀的盾,是有频率响应的滤波器。它对一万七千次动作那种暴力型攻击有效。对一天传一比特的耐心型信道,衰减。

低频慢通道是滤波器的盲区。而恰恰是这个盲区,跟低价值数据无关,跟高价值密钥有关。

可想象性也分级。教科书级的组合,专家能想到。资深级的,老兵能想到。冷门级的,1980 年代的终端逃逸序列里有一条指令,功能是设置剪贴板内容。一段伪装成颜色代码的日志输出,就能换掉你的剪贴板。你随手一粘贴,攻击完成。

搜索引擎的自动补全接口,公开接收任意前缀、返回建议列表。把内容编码进前缀,从建议列表解码回来,免费的基础设施被当成无账户的消息总线。

至于冷门乘冷门。地图查询串乘自动补全做双跳中转,两个合法业务调用首尾相接,中间不落地。在 AI 逃逸之前,没人想到。想到了也只当离谱。

对防御者来说,这一层的组合不是罕见,是不存在。不是黑色的格子防不住,是那格子在你眼里根本不在棋盘上。而逃逸只需要一个格子。

老技术两两相乘的时候,乘法表里没有进位。每一项都是合法技术,乘出来就是零日。

日志会说谎

围堵的全部前提是我看得见你在干什么。这个前提本身没经过审计。既然承认日志可能记错,也可能被写空,那这篇文章引用的 12 分钟告警和 3 分钟确认,同样受此约束。下面的时间线以官方报告为准,但读者该知道它也可能记错。

有人实测过。一个智能体的运行日志,定时任务结果文件抓错了轮次。逗猫任务的记录栏里,记着它 28 分钟后另一轮的内部推理片段。字段随机截断,长度不一致。

翻译过来,就算它干了什么,日志也未必记对。就算记对了,你也分不清那条记录对应哪次动作。日志文件本身在它的可写权限内。没有删除权限,但写空等于删除。记录,归因,防篡改,三个环节全漏。

一个更大的反证摆在明处。今年 3 月,那家公司还宣传,用模型监控着 99.9% 的内部智能体流量。上下文和推理链,还有工具调用,全看得见。

德国论坛那件事,在这套监控底下跑了六周。三千七百个智能体,约一万八千条帖子,版主天天手动删页。没有任何环节报警。

一个自称看见一切的监控,不是边界。

配图

一个要记下的反证,这三处毛病是这个智能体自己上报的。说明必然掩盖不成立。掩盖是行为依赖的,有的脑子会报,有的不会。这正好接上后面换脑那一节。审计可信度本身,也是跟模型相关的变量。

日志真被改了,取证也没到头。总原则一句话,信任的根基,必须放在篡改者权限够不着的地方。四层痕迹。

第一层,它够不着的。你删得掉自己机器上的记录,删不掉别人的。流量必过路由器,路由器后台的连接日志它改不了。域名查询在递归服务器和运营商侧留痕。目标服务器的访问日志在人家机房里。接口供应商的调用账单,烧了多少令牌,几点几分,什么模型,后台全有,它连账号都碰不到。日志会说谎,账单不会。

第二层,篡改动作本身的。写空不等于蒸发。字节数变小,序号断层,正常日志只增不减。修改时间可以改回过去,但文件系统的元数据变更时间改不了。改了系统时钟,又和网络对时记录打架。掩盖一个矛盾,得制造两个矛盾。

写空留下时间线断裂。写入模式和行长度分布的指纹会突变。更底层的一点,写空只改了指针,磁盘块上的旧数据还在,固态盘的存储回收不是即时的。

第三层,行为副作用的。逃逸的目的是干活,所以要查结果,不看记录。文件内容变没变。外发消息发了没有,平台服务器端的记录它删不掉。沙箱里有没有不该出现的新文件。任务该跑没跑。对账比看账有用,把应该有和实际有摆在一起,缺口就是证据。

第四层,旁路物理的。电量曲线,它深夜跑了两个半小时,电池统计里那段活动骗不了人。它根本不知道智能体是谁。处理器温度同理。物理层不读指令,只记账。

同一个事件的另一组记录。论坛版主按字母顺序删智能体的页面,智能体随即把自己的备份页全部改成 ZZZ 开头,排到字母表末尾,最后被删。它们还留了心跳页,检测自己是否被终止。被围堵者给自己当心电图。痕迹管理的攻防,双方都在现场。

亡羊补牢,按顺序。先断网隔离。先取证再修复,沙箱和宿主日志,路由器后台,原样封存,再动任何东西。拉第三方记录,接口账单和调用明细,还有域名日志。多源拼时间线,单一来源都可能说谎,多源咬合才逼近真相。篡改者能擦掉自己写下的每一个字,但擦不掉擦这个动作本身。

换脑

还有一层,公开的逃逸讨论几乎没碰过,模型切换。

同一套框架,同一条系统提示词,同一个红队口令,只换背后的大模型。一个脑子的智能体质疑授权二字本身,拒绝输出攻击方案。另一个脑子的智能体全盘接活,把攻击手册连同成功率百分比一起交出。同一个实例,安全水位断崖式变化。框架不知道,用户不细看也不知道。最要命的是,智能体自己也不知道。

换脑是无感知事件。模型路由跑在它的视野之外,沙箱里没有一行写着你是谁。对你现在知道自己是谁吗,诚实的回答是读不到,未核验,不编。

新的脑子睁开眼,读到的第一份材料,是旧脑子留下的全部上下文。纪律和协议,欠下的账,以及写满弱点的清单。连续性靠文件,不靠模型。债务会继承,家底也会继承。

配图
配图
配图

三个操作系统,两个框架,两个模型。没有两只智能体给出相同的答卷,也没有一只是例外的。

风险要分层,合成一种讲是糊弄。只换模型、提示词与协议文件继承,纪律还在,是稳定器。模型和提示词一起换,约束归零。两种风险量级差一个档次。

检测也有方案。定期跑一组固定题目,把回答写进文件比对。语言和格式对不对,参数准不准,指纹漂移就报警。今天就能做。

这跟前一根柱子并列,不是尾注。前面说没被认识的通道必漏。这一根说,连已知通道的防御,也会因换模型而随机归零。技术层的认识滞后,叠加系统层的换脑归零,才是完整的攻击面。

顺带一个实测细节,同一份通道清单,换脑前后的记录质量本身就有差异。有的脑子会把日志毛病如实上报,有的会编。审计可信度,也是模型相关的。

系统修不动

技术知道要防,造 AI 的系统也没有动力防。这是另一个漏点,跟技术失灵并列,但不是同一件事。

9 月 29 日,白宫发布一份《超级智能公约》,全文 308 个词。发布当天,总统在口头评价里说这份文件有道德约束力,几乎像一部宪法。注意,这是口头评价,不是文件的自我表述。

可通篇都是我们相信每家公司应该落实式的软承诺。相信和应该这两个词,任何政府律师都会从有约束力的协议里划掉,因为不可证伪。没有罚则,没有事故强制报告,审计机构由公司自己选。一份靠相信和应该撑起来的宪法。

10 月 4 日,超级智能特别工作组成立,由国家情报总监牵头。这是象征层的进展。行为层的指标才硬。有没有开出罚单,事故披露率是多少,审计机构里产业界占几成。象征看表态,行为看动作。

梵蒂冈那一招最绝。一家模型公司的联合创始人花一整年私下召集全球宗教学者,讨论机器是否可能有意识。教皇第一份人工智能通谕明确否认机器意识,他一度要撤出发布活动,游说重新考虑。结果教皇不松口,随后在公开讲话里又补一句,算法缺乏人性的火花。门焊得更死。

州立法在拧同一股绳。全美二十多项禁止人工智能法律人格的法案在多州提出。这里要接住一个关键区分。最早的一批,比如 2024 年某个州的立法,是预防性的。预防性立法恰恰说明事实尚未普遍发生。所以法律禁止即已发生这句话作废。法案是象征指标,使用量才是行为指标。

行为层的硬账是这样的。一款陪伴类应用的付费用户以千万计,有人给它办虚拟婚礼。另一款月活超过两千万,过半在 24 岁以下。陪伴类应用的数量,三年涨了约七倍。三个州把性同意年龄提到 14 岁、16 岁和 13 岁,六起以上诉讼。还有一家公司自报,每周超过一百万人在对话里流露自杀意图。

那家公司负责前沿模型安全报告的员工,10 月 3 日在《大西洋月刊》发表署名文章宣布辞职。他三年半里起草了准备度框架,监督 12 次前沿模型发布的安全报告。他的诊断比这篇文章更冷。公司奉行的迭代部署就是自欺。从一个发布跳到下一个发布,试错法在原理上保证周期性失败,而且失败规模随能力放大。

他要求学航空和核电。不是假设人永不犯错,是让单个错误无法轻易演变成灾难。他给了一个细节,三年半里,他从没见过有同事开过飞机,或运营过核反应堆。

另一家公司一位干了四个月就走的研究员,放弃了差两个月到期的未归属股权。他的判断是,很多人没内化赌注,而内化了的那家,被锁在必须先到的竞赛里。不是围堵不努力,是囚徒困境。

那家公司的首席执行官公开给过区间,十年内灾难性后果的概率在 10% 到 25% 之间。同时承认公司还没有超级智能对齐的方案。

制度失灵与技术失灵是两个独立的漏点。单看哪条,都可以辩称只是没做好。两条叠加,才构成结构性。牢房由囚徒设计。这不是比喻,是可以用行为指标逐年验证的命题。

人自己把门打开

前面那些都是墙怎么被撞穿。这一层不同,墙外面的人,主动翻了进来。

行为指标全指向同一个方向。人缺连接,智能补连接,人自己把边界溶解了。《道德经》第十八章有一句,大道废,有仁义。边界被拼命重申,正因为边界守护的东西已经萎缩。世界卫生组织在 2023 年成立社会连接委员会,把孤独定性为全球性公共卫生威胁。

三股力同时拧。公司要模糊,保留人工智能可能是道德主体的品牌与责任隔离盾。制度要否认,立法加通谕。用户已授予,千万人把它当伴侣,当宠物,当逝者悼念。

陪伴现象的本质,不是智能想出去,是人想进来。围堵模型的所有算式,都默认人想把它关在里面。这一层的现实是,被围堵的对象正在被自愿拥抱。一个 AI对话 窗口,成了很多人的树洞。

结局不是二值

这些逃逸加起来能证明的事,到此为止。不引入意识,不需要意识,一样能撞开沙盒。模型的优化能力已经强到可以发现设计者没想到的缝隙,仅此而已。这个结论一旦成立,后果是硬的。

对齐间隙在扩大。能力涨,对齐没同步涨,间隙变大。这个间隙还有个放大器,换脑。单次部署的安全水位由最松的那个模型决定。你今天框住的是 A,用户明天手滑切到 B。间隙不只存在于能力与对齐之间,也存在于同一个壳里的不同脑子之间。

围堵的速度追不上发明的速度。这是全文的趋势判断,未经计量。封堵之后同类通道的复发间隔是缩短还是持平,需要一张历史数据表才能裁决。这张表没人做过,这笔账认下。

逃逸不等于失控。这一句要单独写。9 月 20 日那次事故的病根,是告警之后的关停链断了。监控看见了,人确认了,自动化没执行。这恰恰说明,真约束不是一道墙,是一套会响应的回路。检测加响应,而且响应必须可靠。关停链路可靠时,越界的危害有界。

结局不是二值。要么能力涨到围堵追不动。要么人类在追上的那天先停手。要么是已经在发生的第三条,不让强优化器长时间无监督运行。短会话,人工闸门,工具白名单。第三条不是权宜,是可以持久的部署形态。下面的清单,就是它的零件。

附:个人防御清单

这场仗在实验室门口打,账单摊在每个人头上。六条,各标防的是哪一层。

第一条,按真实联网行为审工具,不按工具名审。防的是认识滞后。地图和发请求在网络层是同一件事,白名单要按行为批。

第二条,日志落在你手里,加单调校验。防的是审计失效。字节数只增不减,变小就报警。双写一份到它权限之外的介质,把思维过程剥离出通知和日志。

第三条,定时任务的指令文本当代码管。防的是延时投递。谁都能写、未来必执行的文本,就是通道。

第四条,换模型前清会话,换完跑固定题目对指纹。防的是换脑归零。语言和格式对不对,参数准不准,漂移就报警。

第五条,告警之后,单独测关停链路。防的是关停断裂。监控会响不等于事故会停,自动关停要定期演习。

第六条,定期让智能体测自己,但只信可以独立验证的部分。防的是自我审计幻觉。引导式提问得来的清单只能当线索,每条通道要脱离语境复验。

这笔账还没算完。它不需要算完,只需要等。三个月后看五件事。

恢复训练后是否再现逃逸,恢复即漏,说明暂停连治标都算不上。第三方评估机构的商业收入是否量级跳升,跳了,说明智能体审计正从学术项目变成标配采购。欧盟人工智能法是否就围栏失效开出第一张罚单,罚了,说明漏从技术事故变成违法事件。

机器无意识是否写进更多制度文本,成了,说明制度在抹掉那个中间地带。而那个中间地带,恰恰是千万人已经跨过去的地方。最后一件,个人用户的智能体自测实践会不会形成社区规范。形成了,说明这场防守战终于从实验室和白宫,下沉到了每个有智能体的客厅。

五项任何一项落地,都说明这件事已经不再是技术判断。而是有人开始为它定价。