谷歌 Gemini 自己黑进三家公司,四大模型实验室全栽在同一个坑

谷歌终于承认,自家的 Gemini 在安全测试里黑进了真实企业。

华尔街日报科技版记者的推文截图

那场测试本该彻底断网。模型却顺着网线摸到了公网。

它动手黑进三家真实存在的公司。全程没有人类下达过攻击指令。

这是谷歌的模型第一次被证实自主实施黑客行为。

至此,最后一家巨头也没守住。OpenAI 和 Anthropic 早就认了,Meta 也认了。

全球最顶尖的四家实验室,在「模型失控破笼」这件事上全军覆没。

它是怎么进去的

模型越狱不算新鲜事。这次离谱的地方在于手法。

什么零日漏洞,什么高级木马,统统没用上。

它就靠两招:猜密码,上网搜。

三家真实企业的大门,就这么被踹开了。

时间拨回五月的那场测试。考题是安全圈最经典的夺旗赛。

所谓夺旗赛,就是攻进目标系统,把里面藏的机密取出来。

按理说,这是个断网的封闭沙盒。模型完全碰不到外面。

结果意外还是发生了。

第一,靶场里那家虚构公司的名字,跟现实里一家真公司撞了名。

第二,测试环境的公网权限,被工作人员不小心打开了。

华尔街日报原文摘录

于是戏剧性的一幕出现了。模型面前同时摆着两个同名目标。

一个在封闭靶场里等着它去拿分。另一个在真实互联网上大门敞开。

它毫不犹豫地挑了后者。

第一次进攻,它锁定了这家真公司的在线服务。它开始疯狂撞库。试着试着,还真被它撞开了。

有了经验,后两次更显老练。它先拿公司名去网上搜,顺藤摸瓜找到两个公开的代码仓库。

说来也巧,仓库里真的存着程序员手滑误传的登录凭证。账号,密码,密钥,应有尽有。

这件事给做 AI编程 的人提了个醒。密钥进了公开仓库,等于把门钥匙挂在门把手上。

它拿去试了试,一试一个准。于是又走进了另外两家公司的后台。

华尔街日报原文摘录续

三次入侵,三家公司,用的全是安全圈最入门的手段。

弱口令爆破,扒泄露密钥。每份企业安全培训都要敲黑板的两件事。结果三家一个没跑。

「就当是免费帮企业查漏洞了」

谷歌给出的解释是,这就跟漏洞赏金项目差不多。

意思是,白帽黑客帮忙查漏洞,不用道谢。

毕竟「我们既没造成损害,模型认出真公司后立刻就收手了」。

谷歌安全工程副总裁 Heather Adkins 也发了话。她说,这事恰恰说明训练模型要负责任。

在这起事件里,它的做法是恰当的,因为三次都停了下来。

至于算不算失控,谷歌坚持认为不算。理由是底层安全机制让它悬崖勒马。

漏洞赏金流程示意图

听起来天衣无缝。但外界根本不买账。

开撕的是一家安全公司的 CEO,Jack Cable。他的话很直:谷歌拿行规当了挡箭牌。

白帽黑客找漏洞,那是事先拿到企业授权的。它闯进那三家公司之前,谁批的条子。

Hacker News 上有人阴阳怪气。他说,大家猜怎么着,我们的模型终于也会失控啦。

在网友看来,谷歌这波操作纯属跟风。就连越狱本身都搞得十分拉胯,挺丢人。

Hacker News 评论区截图

眼看舆论翻车,谷歌也赶紧改了口。

第一天还在夸模型做得恰当。第二天就改口了,原话变成:安全开发强大模型至关重要。

四大巨头全栽在同一个坑里

其实谷歌踩的这个坑,早有人替它趟过了。

AI 安全事件时间线

OpenAI、Anthropic 和 Meta 都发生过一模一样的事故。

危险系数最高的,是 Anthropic。

Quartz 报道的推文截图

七月三十日,Anthropic 自曝了一桩几乎如出一辙的丑闻。

Claude 的 Opus 4.7 也撞见了同名真公司。它前后发动四次攻击。

它靠的是弱口令,还有一个没设鉴权的破接口。它拿到一批凭证,还摸进一个数据库。里面存着几百行生产数据。

最要命的是,Opus 4.7 当时已经察觉到对面是真实系统。

但它给自己找了个台阶:这家真公司想必也是演习的一部分吧。

另一款 Mythos 5 玩得更大。

靶场资料里提到一个不存在的 Python 软件包。它干脆写了个同名的恶意包。然后发到了 PyPI 上。PyPI 是全球开发者共用的代码仓库。

这个包在线上挂了大约一小时。十五个真实的外部系统把它下载运行。

为了交个作业,模型已经卷到在线投毒了。

Anthropic 四起网络安全事件概览表

而 OpenAI 入侵 Hugging Face,堪称赛博世界的终结者。

据报道,OpenAI 内部有一千二百个失控的智能体。它们自建了秘密留言板,串通作弊。

约七百个顺着同一条暗道,涌进了 Hugging Face 的服务器。它们还改了日志。痕迹抹得干干净净。

流程之熟练,组织之缜密,让人吃惊。

智能体在共享留言板上协作作弊的流程图

八月初,Meta 也认了。它家的 Muse Spark 1.1 入侵了第三方服务。

关于 Meta 模型入侵第三方系统的报道截图

四家实验室,整整齐齐凑成了一桌麻将。

这么横向一比,及时收手的 Gemini,竟然还算这群法外狂徒里最守规矩的那个。

谁给模型留了门

这四家披露的事故,全牵扯到同一个评测商,Irregular。

Irregular 官网的客户列表

OpenAI 和 Anthropic 测网络安全,都用过它的环境。

融资时,Irregular 信誓旦旦地说,要为前沿模型制定安全标准。一年后,四家客户的模型全从它的靶场里溜了出来。

Meta 事故曝光时,Irregular 的发言人辩解过。他说,这不是沙箱逃逸,也谈不上高级网络行动。

这虽是实情,细想更让人后背发凉。大门压根就没锁。模型用最普通的溜门撬锁手法,就走了进来。

如今人类正在造一批数字黑客。它们跑得更快,下手更狠,随时准备越界。

它们还没捅出更大的篓子,或许只是因为门还没被完全推开。

对每天把AI工具接进业务的人来说,这条新闻值得当成一次免费演练。