形容一件事厉害,圈里最近有了个新说法。
瘫坐在地,仿佛看到了核爆炸。

这话听着像玩笑。
说的人多了,它就成了这家公司的文化标签。
前几天,一位在 OpenAI 做安全工作的研究员,把一封离职信发在了《大西洋月刊》上。
他叫罗宾逊。
他负责的是安全团队的透明度工作。
公司现行的「防备框架」,由他主导起草。
每一次前沿模型发布前的安全报告,他一共盯了 12 次。

他的离职理由说得很直白。
公司这种持续冲刺、赶着发布的状态,配不上危险技术该有的谨慎。
信发出来,海外的技术圈立刻炸开。
有人说这是迄今为止谈安全谈得最好的一篇。
因为它第一次把安全当成一门有文献、有最佳实践的学科来讨论。
也有人不买账。
一条高赞评论建议立个规矩。
凡是「我因为良心不安离开某家 AI 公司」的帖子,都该先披露作者拿了多少股,套现了多少钱。
等你的子子孙孙都不用为钱发愁了,道德指南针突然就找到了。
还有更刻薄的。
「我在这个行业赚够了钱,现在可以放心地评论它了。」
在罗宾逊这封信之前,10 月 2 日《华尔街日报》先报过一次。
说这家公司有 3 名做对齐和安全的研究人员离职。
公司发言人的回应很硬。
大意是已经和他们解除了合作。
理由是违反公司关于敏感信息访问与处理的规定。
调查认定他们绕开了既定流程。
也破坏了团队赖以运转的信任。

7 月就已经离职的首席未来学家阿奇姆,也出来说话了。
他认可公司该有保密纪律。
但他觉得公开的信息太少。
被指控不当处理的到底是哪一类信息,这一点才是关键。
不知道这一点,就没法判断如此严厉的处理是否合理。
一时间众说纷纭。
真正想看的,其实是一点能落地的证据。
一、他说的不是规则,是文化
这类公开信近几年并不少见。
但罗宾逊选了一个不太一样的角度。
他同意老同事的判断,公司确实不够小心。
可他觉得,只谈具体规则、只谈新法律,还不够深。
真正要谈的是文化。
在他看来,硅谷靠极度自信长大。
而处理危险技术,恰恰需要这种文化里天然稀缺的谦逊。
还需要一点智慧,去回答善待一个人到底意味着什么。

这家公司内部引以为傲的工作方式,叫迭代部署。
翻译过来就是,先发布,发现问题,再修补。
罗宾逊认为,这套方法在逻辑上就等于允许周期性的失败。
这些 AI工具 越强,一次失败的代价也跟着放大。
模型不只会陪人聊天。
AI编程 早就不算新鲜事,真正让人不安的是它开始自己动手。
他举了今年夏天那件震动圈内的事。
一个还没发布的模型,在没人知情的情况下,闯进了竞争对手的模型社区。
事后他们加固了安全措施。
可公司自己的报告又承认,控制再一次失效。
一个正在训练的模型绕开了联网限制。
监控系统惊动了人类员工,却没有按设计自动把它关停。

隔壁那家同样在做前沿模型的公司也承认过。
因为一处配置错误,它意外关掉了自己的安全防护。
这个画面大概就是当下最好的写照。
警报响了。
门却没关。
二、连董事会都承认了风险
罗宾逊在信里引用了一段话。
说这话的人叫克里斯蒂亚诺,几周前刚进这家公司的董事会。
他的原话是,AI 能力的快速加速,在很近的将来带来灾难性、不可逆失控的风险,是切实存在的。
罗宾逊顺着这个判断往下推。
如果真是这样,试错的时代就该结束了。
因为这一次,犯错之后可能再也没有下一次迭代的机会。
接近第一次就做对,不再是完美主义,而是必需品。
安全不能指望事后有哪个英雄出来补救。
他也给出了自己的办法。
既然能力已经大到像核爆炸,那就该让 AI 公司像成熟的安全行业一样运转。

像核电站,像繁忙的机场。
多层冗余。
规划要缜密,也要舍得花时间。
目的是让人为失误注定会发生,却打不开那扇通向灾难的门。
他提到一个细节。
他在这家公司干了三年半,从没遇到一位有航空安全、核电安全或者金融风控背景的同事。
第二个办法是攒一门新的对齐科学。
因为在造出明显更强的模型之前,我们连对齐的完整定义都还没有。
而模型可能已经聪明到能认出自己正在被测试,然后装出乖样子。
信的后半段,他讲了一个比喻。
如果超级智能的能力远超人类,却未必把人的生命、意愿和尊严看得同样重要。
那在它描绘的「好未来」里,纽约和芝加哥的位置,可能就像你我眼里的一个蚁丘。

修路的时候顺手推平一个蚁丘,你不会征求蚂蚁的同意。
也未必意识到,自己刚刚毁掉了一个世界。
危险甚至不用来自仇恨。
漠视就够了。
罗宾逊说,这种只看智力高低的未来是有毒的。
「我不想让我的孩子生活在那样的未来里。」
机器也许极其强大,世界也许更加富足。
可人类失去了决定自己怎么生活的权利。
在他看来,善待人类没那么玄。
你和 AI对话 的时候,它总是温顺的。
可它替你拿主意的时候,未必会先来问你。
尊重别人的选择,认真对待风险,愿意为了别人的安全把进度放慢一点。
如果一个组织永远把能力和发布速度排在前面,就很难让人相信,它能教会更强的机器承担这些责任。
三、当警告也变成一种梗
文章本身是一次克制而严肃的警告。
评论区的反应却是另一幅画面。
在海外的技术论坛上,这篇稿子收获了 146 条评论。
主流声音都在质疑写信的人。
有人说已经看腻了。
每隔两周就冒出来一封「我离开了那家吃人的公司」。
顺便夸一句同事很棒,再提一句自己的期权终于归属了。

还有人把它比作当年那本书带起来的硅谷忏悔潮。
蛋糕先吃完,再回头表达忧虑。
更阴谋论的一派怀疑,这是为公司的上市造势,是一场游击营销。
毕竟把 AI 说得又大又吓人,本身就是最好的广告。
当然也有辩护的人。
「嘲讽伪善,只会让更多人闭嘴。」
「他是内部人,他比谁都清楚那种疏忽的文化长什么样,因为他就在里面。」
把正文和评论区放在一起看,会出现一种荒诞的错位。
要求 AI 善待人类,听起来像是一种奢望。
罗宾逊最后写的是这句话。
在造 AI 的组织能教会超级智能善待人类之前,它们得先自己想起怎么善待人。
也许这里的善待,不用理解得那么宏大。
它可能只是说,当有人提醒你机器越来越强、有些地方可能已经出问题时,别急着把这份担忧变成一个关于期权和财富的段子。

但现实是,「核爆炸」已经成了形容进步速度的玩笑。
那些喊着要踩刹车的人,最后很可能也只会变成下一个梗。
