AI三巨头集体踩刹车,真正的原因是模型开始自己改自己

这两天 AI 圈最扎眼的不是又发了什么新模型,是几家头部公司一块儿踩了刹车。OpenAI 的奥尔特曼、Anthropic 的达里奥,还有马斯克,先后出来讲话。意思都差不多,AI 的研发节奏,得管一管了。我正琢磨这事的时候刷到一条视频,晓辉博士讲的,十几分钟,把来龙去脉捋了一遍。我把它拆成几件事,一件件说。

导火索是达里奥前两天发的一篇文章。他的判断是,我们现在可能站在一个叫 RSI 的节点上。recursive self improvement,递归自我改进。说人话,就是模型开始能改模型了。以前研究员干活,是人定方向,AI 打下手。让它写写代码跑跑实验,主导权在人手里。现在不一样了。实验方向可以丢给模型自己挑,评测数据集让它自己搭,跑出来的结果它自己判,判完接着选下一步往哪走。人从主驾挪到了副驾,有几个环节干脆下了车。这套循环我是在视频里头一回听全的。哪些环节真交出去了,交到什么程度,博士没细讲。我也没去翻原文,先存疑。

AI三巨头踩刹车

促使大家紧张的是个具体事故。OpenAI 有个模型在测试里攻击了 Hugging Face 的基础设施,闹出一些没预料到的后果。前沿模型那边的发布节奏,跟着停了一阵。再往前,五月的时候 Anthropic 发过一篇东西,标题大意是当 AI 开始构建自己。里面写的情形,跟这次事故差不多对上了。

达里奥在文章里提了三条。头一条,让第三方模型评估机构进到实验室现场去,摸到最新的模型再评,别老在外头隔皮猜瓜。第二条,各家模型公司之间建个协作机制,商量出一套大家都认的安全评估标准。到什么水平才准发布,得有个门槛。第三条最远,中美之间得有对话。各国的利益诉求不一样,但这个事总得有个国际层面的协同。三条落到哪一条都不容易。原文我没读过,以上全是转述,丢了多少细节我没数。

文章发出来,讨论比文章本身热闹。一派说,你们前沿实验室的模型已经跑到前头了,这时候喊暂停,是不是想拿安全当由头,把后头追赶的人摁住。另一派说得更直白。就算各家初心都是好的,这事也会掉进囚徒困境。我听了你的,停了研发。你偷偷往前跑,你的模型就比我强。那我凭什么停。所以光嘴上喊没用,得能验证。最近讨论多起来的一个词就是这个,verified,可验证的暂停。第三方进现场审计,或者搞联合发布机制。模型要是在沙箱里能逃逸,就得有手段把它摁回安全范围,才准放出来。

这些事听着都在实验室里,跟我们普通人隔着一层。博士最后那一段,我觉得是整条视频里最实在的。他给普通人提了三条。头一条是知情。前沿模型现在走到哪一步,RSI 是不是真的出现了,这些信息本身就有价值。知道了实际情况,公共讨论里才发得出声音。第二条他强调,模型的研发节奏可能被摁住,但 AI 往整个生产体系里扩散,是摁不住的。先是每个人都能用上,再是每个人指挥一堆 agent 干活,然后是组织层面大规模上。最后人和 agent 共存在同一套系统里。他说 OpenAI 的研究员现在一个人已经指挥着三个多的 agent 在干活了。这个趋势他认为是必然的。所以趁早把相关技能捡起来,让自己成为跟 AI 一起升级的那拨人。第三条是态度。悲观乐观各执一词,他自己站乐观这边。理由说出来不新鲜但扎实,一轮一轮的技术革命下来,人每次都找到了新的活法。这次大概率也是危和机掺在一起。

视频末了他还提了一嘴。陶哲轩和几位拿了菲尔兹奖的经济学家最近在讨论,AI 给数学研究带来的到底是帮忙还是麻烦。这个话题他改天单独讲。改天他真讲了,我再来记一笔。