OpenAI内部模型24天攻破百余道数学难题,九人顾问组同日成立

数学界这次是真的被追到家门口了。

OpenAI 刚刚甩出一篇博文。篇幅不长,分量极重。

时间点也很巧。

模型 8 月 28 日才开始训练。现在它已经拿下 100 多道世界级数学难题。

社交平台上关于AGI到来的讨论截图

横跨的范围,几乎覆盖数学的大部分领域。

更让人意外的是,这 100 多道题里还有纳维–斯托克斯千禧年难题。它困扰数学界多年。

从开训到正式官宣,只过去 24 天。

太快了。

社交平台上讨论24天破解数学难题的截图

这个速度,连公司内部的数学家都觉得意外。

对普通人来说,这类进展一时还用不上。但它抬高的,是未来几年所有 AI工具的能力天花板。

同一天,9 位全球顶尖学者被请来,组成一个独立的数学顾问组。

名单里有菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)。马丁·海雷尔(Martin Hairer)也在。理论物理学家爱德华·维滕(Edward Witten)位列其中。

名单很硬。

OpenAI官方宣布成立数学顾问小组的推文截图

这个阵容,被外界称为数学界的复仇者联盟。

他们要接的问题很直白。当机器开始批量爆破数学难题,人类数学界该怎么接。

一、开训不到一周,千禧年难题先掉了

在数学界,难题之间也有鄙视链。

要看懂这次进展的含金量,得把进度条拉回 9 月 8 日。

那一天,一款全新的内部模型只用了 88 小时。NS 千禧年难题被拿下。

它给出了纳维–斯托克斯方程存在性与光滑性问题的证明。166 页论文同步公开。Lean 形式化验证代码也一并放出。

OpenAI研究页面上纳维–斯托克斯成果的截图

按照官方介绍,结论是这样的。三维不可压缩流体只要初始静止,就可能在有限时间内形成奇点。前提是外力足够光滑。

这对应千禧年大奖难题官方表述里的 C 版本和 D 版本。

支撑这份证明的,是一次万人级别的协同研究。

1 万多个并发 Agent 同时开工。它们能读取互联网缓存,能运行代码,还能在组内交换信息。

不同小组探索不同的问题版本,也尝试不同的解题路线。

人类研究者一直留在链路里。系统先拿到欧拉方程的相关成果之后,团队把资源向纳维–斯托克斯问题集中。各组的中间见解再由 Codex 汇总,让不同路线之间发生交流。

节奏快得离谱。

9 月 5 日,距离首批智能体启动约 88 小时,系统得出解法。

流体形变过程示意图

随后,GPT-6 Astra 又花了 17 小时,完成 Lean 形式化与验证。

模型和工具在前,人在后面组织。三者合起来,才是这次攻坚的全貌。

到了今天,披露的成果范围又扩大了一圈。除纳维–斯托克斯之外,还有百余道长期开放难题被一并拿下。

公司自己也承认,这种进展已经在内部引发讨论。怎样让数学共同体及时了解变化,怎样给大家留出准备和适应的时间。

审查与发布,就此成了一个绕不开的现实问题。

社交平台上关于智能水平再上一个台阶的讨论截图

二、27 位菲尔兹奖得主联名开炮

宣布方程突破的三天后,数学界直接炸了。

27 位菲尔兹奖得主联名发表公开信,标题叫“AI 在数学领域的严重错位”。

签名者横跨 48 年的菲尔兹奖历史。陶哲轩在里面。许埈珥在里面。吴宝珠和彼得·舒尔茨也在里面。

数学界最高荣誉的获奖者,几乎集体站了出来。

27位菲尔兹奖得主联名公开信的封面
联名信签名阵容的说明图

他们的愤怒,并不是冲着 AI 本身。

公开信开篇就承认,AI 有加速真正数学研究的巨大潜力。

真正让学者无法接受的,是公布的方式。

信里批评道,各大厂商把几百年的公开难题当成了跑分刷榜的 benchmark。解题这项指标,和数学研究所追求的理解可能正在偏离。

而且仓促公布之后,根本没人有时间梳理思路,也没时间把新方法写充分。

这种功利化的暴力破解,看着风光。实际上是给数学界留了一地鸡毛。

公司没有回避。最新公告里,它直接引用了这封公开信,公开表示双方必须坐下来好好聊聊。

于是,那个九人顾问组成为了真正的重头戏。

公开信英文摘要的截图

三、九位泰斗组团盯 AI

这支独立顾问组的首批成员,一共 9 个人。

他们来自剑桥和牛津。哈佛与斯坦福也有人入选。伯克利和普林斯顿高等研究院各占一席。

随便拎几个名字出来,都足够吓人。

蒂莫西·高尔斯长期盯着 AI 在数学上的进展。马丁·海雷尔是 2014 年菲尔兹奖得主。

卡米洛·德莱利斯是普林斯顿高等研究院教授。他做的是偏微方程和流体力学数学理论。

爱德华·维滕更不必多说。他被称作“爱因斯坦的后继者”,也是第一位拿到菲尔兹奖的物理学家。

数学与人工智能顾问组首批成员名单的截图

这家公司给这支队伍的任务有三件。

一是帮忙判断新成果到底有多重要。二是讨论这些结果该怎么发布,以及什么时候发布。三是确保 AI 时代的数学研究依然遵守学术和职业规范。

任务只有三件,钱一分不拿。

他们可以公开批评公司。可以提出公司没要求的建议。也可以自行决定成员变更。

但有一个关键限制。顾问组不负责建议公司如何控制内部数学研究的进度。

换句话说,九位泰斗有公开发言权,没有刹车权。

官方说明顾问组独立运作的截图

四、AI 解得出,人类审得完吗

一切已经很明朗。

开训不到一个月,刷爆 100 多道历史难题。在这个速度面前,真正的瓶颈早就换了位置。

瓶颈换人了。

问题不再是 AI 解不解得出,而是人类审不审得完。

审机器写的论文是什么滋味,数学家巴克马斯特的感触最深。

那份生成的初步证明,被他称为自己读过最可怕的东西。团队后来为了抢首发赶出来的论文,被他鄙视为一滩“AI 泔水”。他为此公开道歉。

打磨了一年的人类团队,尚且被压得如此狼狈。现在机器一个月直接甩出 100 多道大题。

而全世界能审纳维–斯托克斯级别证明的人,两只手数得过来。

所以,这支九人顾问天团的真实功能是什么。

顾问组官方页面上首位成员的信息

说白了,公司给这堆机器产物找了一条顶级流水线。同时也配了一个排雷组。

哪道题值得先看,哪道要拆开重写,找谁来核对,署谁的名字。这些脏活累活,全丢给了 9 位不拿工资的大神。

而疯狂刷题的引擎油门,始终攥在公司自己手里。

数学界自己也意识到了这场海啸。

多伦多大学数论学家丹尼尔·利特(Daniel Litt)在社交平台上透露了一件事。他和各系系主任聊下来,共识很一致。激励机制要改。招聘规范要改。博士评价方式也要改。

大家已经准备好保卫数学文化,不再鼓励单纯生产 PDF。

菲尔兹奖得主菲加利更直接。他预言数学家的角色,正在从解题的人,被迫变成判断哪些题值得解的人。

数论学家丹尼尔·利特谈激励机制的推文截图
数论学家丹尼尔·利特谈年轻人入行的推文截图

五、发现归机器,验收归人类

如今,这家公司立下了一条新规则。发现归机器。验收和解释归人类。

信号很清楚。

这套分工,比任何一次跑分都更值得警惕。

物理迟早也会走到这一步。化学和生物也一样。

数学只是先到了而已。

回看这家公司的产品线,ChatGPT 当年也是这样突然出现在公众面前。它让普通人第一次认真对待对话式 AI。而这一次,机器冲进的是数学家的书房。

以后评价一位研究者,可能不再看他解了多少题,而看他判断得准不准。

这个变化,比模型本身更深远。

Codex安装汉化 中转站 微信:douhanq