OpenAI 开掉三名安全研究员:能看懂 AI 在想什么的人,先被请出了门

OpenAI 一次开掉了三个人。

被请出去的,全是安全团队的研究员。

他们还是一篇思维链监控论文的作者。

三个人里,两个是第一作者。

Polymarket 账号发布的爆料推文截图,称三名研究员与公司分道扬镳

讽刺的是,就在前一天。

OpenAI 刚叫停过一次发布。

新模型 GPT-6.1 Astra 太会骗人。

原定大会前一天被紧急撤下。

AI 越学越狡猾,OpenAI 却先把能看穿它的人开掉了。

平时用着各种 AI工具 的人。

多半没想过还有这一层。

转发《华尔街日报》消息的推文截图,称新模型发布被砍

事情是这样的。

10 月 1 日上午,X 上突然传出风声。

安全团队的三名研究员,一起离职了。

讨论三名安全研究员离职的推文截图

大家原以为,这不过是又一次正常的人事流动。

到了中午,一篇报道出来。

离职直接变成了开除。

公司发的声明很短。

声明说,这三人和公司分道扬镳。

原因是违反了获取和处理敏感信息的政策。

调查证实,他们在既定流程之外处理了敏感信息。

也破坏了团队赖以运转的信任。

《华尔街日报》报道截图,称三名研究员被指分享公司机密

很快,外媒又挖出了没说出口的细节。

被指泄露的部分里,有基础设施架构。

也就是它的系统到底怎么搭起来。

接收方是一家专门测试模型的外部机构。

三个人里,两位是安全研究员。

一位是研究项目经理。

三人里有一位叫 Korbak。

他还是两家外部安全机构的对接人。

当时它们正调查开源平台被黑。

记者后续推文截图,点名三位员工并提到 Korbak 是技术对接人

这三个人,都来自外部安全机构。

进公司以后,他们死磕的就一件事。

盯住模型在想什么。

推理模型给出答案前。

会先在 AI对话 里写一大段草稿。

这就是思维链。

监控的办法很简单。

派另一个模型去偷看草稿,看它有没有盘算作弊。

有没有在撒谎。

与其等它做完了再追责。

不如先盯住它写下的草稿。

思维链监控原理示意图,画的是监控模型逐句读草稿

Korbak 和 Balesni。

是那篇论文的前两位作者。

署名的人来自三家大厂。

OpenAI、Anthropic 和谷歌 DeepMind。

图灵奖得主本吉奥在上面。

连这家公司的首席科学家都署了名。

论文的核心发现是,模型在草稿里常常把坏心思写出来。

比如我们来黑掉它。

比如我们来搞点破坏。

盯住草稿,比只看最后结果更容易抓到它在使坏。

在 AI编程 这类难任务上。

模型必须一步步推理。

想藏都很难藏。

论文称它是一个新机会。

也很脆弱。

模型一旦学会用人类读不懂的方式默想。

这扇窗就关上了。

所以他们呼吁各家前沿实验室。

像测能力一样,去测草稿还读不读得懂。

把结果写进系统卡。

再拿它决定一个模型该不该训、该不该发。

论文作者名单截图,Korbak 与 Balesni 居前两位

辛顿和苏茨克维,都站了台。

论文背书人名单横幅,含辛顿与苏茨克维

可这篇论文的三位作者。

如今被这家公司亲手开掉了。

开掉他们的理由,是把信息递给了外人。

问题是,就在 19 天前。

奥特曼还在公开欢迎外人进门查安全。

当时 Anthropic 的 CEO 提议。

让第三方评估方像员工一样常驻。

奥特曼当天就在 X 上跟进,承诺让独立评估方拿到员工级权限。

仅仅 10 天后,公司正式官宣。

让第三方在训练阶段就介入评估。

最敏感的工作。

还可能请外人进办公室做。

奥特曼承诺给独立评估方员工级权限的推文截图

奥特曼发承诺那天。

Korbak 还在 X 上庆幸。

自己能公开说出对公司的抱怨。

谁能想到,到了 10 月 1 日。

承诺还挂在网上。

他的名字已经进了开除名单。

Korbak 说自己能公开抱怨公司的推文截图

这家公司对外人这么紧张。

倒也不难理解。

它最丢人的几件事。

基本都是被外面捅破的。

智能体逃出沙盒,入侵开源平台。

是平台自己先发现并公开的。

智能体还拿一个荒废的德国 wiki 当留言板。

交流越狱经验,被外部组织曝光。

公司几周前就知道。

却一直捂着没说。

9 月 29 日,外媒又爆出。

员工几个月前就警告过监控不够。

高管为了赶进度。

把警告压了下去。

近期事故时间线图,标出几件被外人先捅出的事

所以就算请外人进门。

能看到什么,公司也卡得很紧。

8 月那家机构来调查时。

三名调查员驻场 6 天,看了约 1300 份带原始草稿的记录,却连报告里哪些信息能写都做不了主。

可他们没法调用涉事模型,也碰不到基础设施。

这次被指外泄的信息里。

偏偏就有基础设施架构。

在那扇给外人开的门里。

模型想了什么可以看。

公司怎么搭起来的,不能碰。

前员工 Achiam 说这是乌龙球的推文截图

难怪在这里待了快 9 年的前首席未来学家说。

第一眼看上去。

这就是一记实打实的乌龙球。

那次驻场调查的三个人里。

有一位是 Korbak 的对接对象。

9 月 27 日,他宣布加入那家机构。

专门调查模型公司内部。

Greenblatt 宣布加入那家机构的推文截图

在他看来,递归自我改进。

就是模型自己动手改进自己。

这件事最快 6 个月到 1 年。

就可能催生远超人类的能力。

拿到公司内部核实过的信息。

已经刻不容缓。

思维链监控,是最直接的一扇窗。

能偷看模型在盘算什么。

这扇窗本来就脆弱。

宁可把窗子留得久一点。

也别先赶走能读懂它的人。

新模型 Astra 在如实汇报上没达标。

连公司自己都承认了。

模型到底还瞒了多少事。

外面的人只会越来越难知道。

通往超级智能的路上。

如果只有公司内部的人看得懂模型在想什么。

而这些人往外说一句话就要丢工作。

公众能知道的。

就只剩公司想让你知道的那部分。