哈佛教授用 Claude 搞科研,90 天出 36 篇论文稿

全球拿 AI 做科研的人,姿势可能一开始就错了。

有位哈佛物理学家发现,问题不在模型本身。

在于我们总把它当成一个人。

他叫施瓦茨,量子场论教材的作者。

他试了大半年,摸出一套完全不同的用法。

别把 Claude 当科学家。

那些够不着的深层问题留给自己。

只挑它最擅长的题交给它。

结果有点吓人。

他熬了好几周,逐行写代码才做完的计算。

它二十分钟就复现了。

他又多追问了一句。

接下来几周,它算出 15 个费曼积分。

这些积分此前从来没人算出来过。

三个月过去,他手里多了 36 篇论文初稿。

从对撞机里的粒子出发。

一路做到巴拿马雨林里的树。

横跨 18 个学科。

Anthropic 官方发布的推文截图

图注:Anthropic 在社交平台上发布这篇长文的推文截图。

他挖出了 Claude 最强的一面

去年 12 月,施瓦茨让它给自己当科研助手。

用他的话讲,它像一个能干的研究生。

干活快 20 倍,论文最后也写出来了。

过程却很磨人。

很多科学家有同款体会。

新闻里 AI 一会儿解开数学难题,一会儿刷新纪录。

自己上手一用,总觉得隔着一层。

这种落差在他看来有迹可循。

AI 科研的头条大多出在数学里。

那是唯一能把问题完整写下来的学科。

答案还能被绝对验证。

可大部分科学并不长这样。

他借了物理学里的一个词,叫阻抗不匹配。

两个系统各自运转良好,接在一起却配不上。

放到这里,一头是科学家想要的。

另一头是模型最擅长的。

于是他按它实际的样子来使它。

它算不上一位能独立拿主意的同行,只是一件顺手的 AI工具。

深层概念它接不住,可它几乎什么领域都懂。

写代码是强项,读论文和数据也是机器的速度。

这些 AI编程 类的活,正好落在它的能力范围里。

科研里那种一问一答的 AI对话 用法,其实远远不够用。

他要做的,就是专挑正好落在这些长处上的题。

这类题,他叫作「Claude 形状的问题」。

Claude 形状的问题示意

图注:科学家想做的事和 AI 能做的事只在两小块地方重叠,那里就是「Claude 形状的问题」。

追问一句,算出 15 个新积分

第一个问题,他从老本行里挑,叫散射振幅。

物理学家要靠它从对撞机的碎片里认出新粒子。

它的核心是费曼图背后的多维积分。

难一点的,算出一个就够写一篇博士论文。

为了绕开这些硬骨头,物理学家走了二十年捷径。

这条捷径叫 S 矩阵 bootstrap。

它不硬算积分,靠物理约束一层层排除。

比如知道振幅在哪些地方会变成无穷大,候选就缩到 2 万个。

再加一条对称性,剩下 500 个,就这样一步步缩到 1 个。

约束不够用的时候,就在几个点上把振幅算到极高的精度。

剩下的系数,靠这一步钉死。

S 矩阵 bootstrap 的排除流程

图注:S 矩阵 bootstrap 的排除流程,候选函数被一层层筛到只剩一个。

在施瓦茨看来,这道题天生适合 AI。

一来,它要的数学、物理和计算机知识没人能全部掌握。

二来,答案能被验证,跑两个脚本就能对到任意位数。

它想糊弄也糊弄不了。

他交给它的第一件事,是整理方法。

把散在各种代码和论文里的办法搬进同一个框架。

它很快复现了旧结果,还指出他有个算法写慢了。

真正的突破在后面。

他让它去找还没人算过的振幅。

发现它一直把自己限制在最简单的对数函数里。

于是他追问了一句,更难的椭圆函数能不能也这么做。

费曼积分背后的几何图形

图注:费曼积分背后的几何图形,圈数越多越难算。图里画了气泡图、日出图和香蕉图三类。

这一问,问到了难处。

人类完整算出的椭圆费曼积分只有寥寥几个。

还没有一个完全靠 bootstrap 算出来。

所需的知识散在许多人身上,从来没人试过。

它却没有这个障碍。

整套工具被扩展到了椭圆函数上。

大部分新软件由它自己写,剩下的借自数学界。

BootLoops 项目页

图注:BootLoops 项目页,写明它是帮大模型做跨学科定量科学的工具,代码全部开源。

几周后,30 个积分从头到尾算完。

一半是复现已知结果,另外 15 个此前从来没人算出来过。

回头看,模型能力只是底子。

决定结果的是两次选题。

一次是挑中这道能验证、知识又分散的题。

一次是看出它在给自己设限,追问了一句。

第二次更关键。

那批前人没算出来的积分,全出在追问之后。

这套工具越用越全。

他给它起名叫 BootLoops。

它是套在大模型外面的一层工具和流程,已经开源。

换哪家的模型都能驱动。

两个积分引擎的核心算法。

出自北京大学马滟青团队。

门槛有多低,报道这件事的编辑自己试了一把。

装好之后,只用一句话交代任务。

它自己翻文档、找工具,二十分钟出头,花了约 1.5 美元。

把网上一个新算出的积分系数重算了一遍。

还找出了闭式,和数值对上 157 位。

一套积分,打穿 18 个学科

本来他打算就这批积分写篇文章收工。

可科学里有个巧合。

同样的方程,总会在不同学科里反复出现。

这批工具的用处,远不止物理。

它告诉他,这些积分还能对应到群体遗传学里的贝叶斯证据积分。

系统发育学用 DNA 给物种排家谱树时要算的积分,和为费曼图打造的积分是同一类。

同一类积分在多个学科反复出现

图注:BootLoops 为费曼图造的工具,换个学科照样能用。

为了让工具箱越用越全,他立了条规矩。

老工具要用,新工具也要造。

这样一来,每个项目哪怕失败,都会留下新工具。

它越用越能干,用他的话说,像《黑客帝国》里刚灌完功夫的尼奥。

模型能做成多少事,不只取决于权重,也取决于手边的工具箱。

下一代模型要等实验室发布,工具箱却每天都在扩充。

带进别的学科后,生态学最先出了成果。

中性理论认为,森林里物种的兴衰也许全凭运气。

可这个理论的方程写出来二十年,一直没人能在大尺度上解开。

它认出这是 BootLoops 形状的题,把它解了。

拿巴拿马运河边那块样地的普查数据一对。

树种组成的变化速度快了 4.5 倍。

比中性理论允许的还快,光靠运气解释不了。

于是他跟植物生物学家联手,搭出一个新模型。

把物种之间寿命、生长和繁殖的差异加了回来。

眼下正往全球的森林样地推广。

相关研究的时间线动画

图注:一段演示动画,把历年来用上这套工具的研究按年份排开。

其他学科也陆续出了结果。

群体遗传学里,他们在 57 亿对相邻突变中找到了基因转换的证据。

经济学五大顶刊 4452 篇论文的复现包。

被搬进开源代码逐个核对。

语言学家也拿到了覆盖 6072 种语言的重音数据库。

一位数学家在 1939 年开启的格点积分系列,最后一道难题也被解开。

BootLoops 交出的论文稿分布

图注:三个月里产出的论文稿,从对撞机里的粒子一路做到伏尼契手稿。

这些成果加起来,就是那 36 篇论文稿。

它们从约 400 个候选问题里筛出。

目前都还没正式发表。

他在文末披露了一件事。

项目期间,他在这家公司担任访问研究员。

工具由公司资助,由他本人拥有和维护。

撑起这个产量的工作台并不复杂。

每个项目一个会话,一个总控会话负责协调和验收。

计算交给后台的子 Agent。

还有一个会话专门扮演挑刺的审稿人。

把结果翻来覆去地核查。

Schwartz 的 Claude 工作台

图注:一个总控会话管着一群项目会话,计算交给后台子 AI,另有会话专门挑刺。

它做成的这些题有一个共同点。

答案都能被核对。

正因为算错了瞒不住,他才敢放手让它去跑。

能被验证的地方,AI 就能放开手往前推。

通往另一条路

这三个月,他回答的是一个更大的问题。

智能到底靠什么扩张。

外界衡量 AI 强不强。

看的几乎全是模型本身。

参数多了没有,跑分高了没有,下一代什么时候发。

他看的却是另一件事。

模型的上限由实验室决定。

最后能发挥出多少,取决于挑题的人、搭工具的人,还有定验收标准的人。

至于 AI 该往哪儿走,他用了一个数学概念来比喻,叫凸包。

就是把一个形状所有尖角连起来后,围出的最小凸形状。

人类知识就是这样一个参差不齐的形状。

生物学往一个方向突出去,数学往另一个方向突出去。

一个实验室可能花上二十年。

用一种方法把一组基因研究透。

旁边的基因和别的方法,却一直荒着。

那些人类够得着、但还没有哪个人去过的中间地带,最适合交给 AI。

BootLoops 做的,就是在这些尖刺之间连线,把凸包一点点填满。

人类知识的凸包示意

图注:人类知识像一颗参差不齐的星形,BootLoops 的工具包在尖刺之间连线,填补中间的空白。

AI 去填这些空白,人在科研里的位置也跟着变了。

局面变得太快,几乎没法提前规划。

他说过一个 AI 可能一夜之间就算完的问题,不值得再申请三年的经费去算。

连该怎么带研究生,他也说自己至今还没想清楚。

不过在他看来,只要找对问题,大部分技术活都能自动化。

离不开人的,是概念那一部分。

通往更强的智能,也是两条路。

一条是等实验室训出更强的模型。

另一条是把散落在几十个学科里的工具拼成一个工具箱。

交给一个什么都懂一点的模型,再由人来挑题、追问和验收。

前一条路握在少数几家公司手里。

后一条路不用等下一代模型。

每个会用 AI 的人,现在就能走。

Claude Code会员中转站 微信:douhanq