一支试管里泡着六百万条人工设计的序列。
这些序列自然界从没进化出来过。哪条能用,哪条是废品,全靠旁边的测序仪一次读完。一次读完,一次报出。
今年 8 月的一个早上,研究助理博伊兰调出前一晚的实验结果。测序仪旁的那批序列,是他所在的团队一轮一轮设计出来的。换成传统做法,光是测完这一批,就得花上好几年。
这家机构叫 AI BioDesign,9 月 3 日刚在西雅图对外亮相,离艾伦研究所总部不过几分钟路程。
它背后是保罗·艾伦遗产体系砸下的 9460 万美元。领头人是 2024 年诺贝尔化学奖得主贝克,还有基因组学家申杜尔。

在这个算力决定一切的时代,他们不打算拿这近一亿美元去训一个更大的模型。
钱要花在那支试管上。
一支试管,一次读出六百万条设计
他们的玩法是搭一个狂奔的闭环。
模型提出设计,实验室造出来并测量,结果回馈模型,再由模型决定下一轮造什么。
听起来是大家熟悉的“设计,构建,测量,学习”。真正不一样的地方,是这个圈怎么转起来。
差别在圈怎么转。
这里没有铺满机械臂的自动化车间。一个机械臂都没有。
“规模不来自机器人,来自在试管内部做并行。”执行总监格雷说。
所谓试管内部的并行,用申杜尔的话说,就是劫持进化留给人类的那条细胞流水线。拿它去造,也拿它去测,几百万个分子一起跑。这就是全部。
具体做法并不复杂。把几百万条设计序列丢进同一支试管,让细胞把它们各自造出来,再放到同样的条件下跑一遍。最后交给测序仪,一次读出哪些能用,哪些是废品。一次测完。
这样一来,模型学“设计的规则”时,面对的就是海量例子,而不是自然产生的那有限的一小撮。样本量差了几个量级。
这类设计出来的分子长什么样。看下图。
下图是贝克实验室此前设计的一个结合蛋白。紫色和粉色部分由模型设计,白色是被它整个裹住的胰淀素。

实验不再验证结论,只为喂饱模型
更有意思的是这条产线的考核指标。考核指标变了。
实验室按五六人一组编成小队,各自死磕一个具体的生物设计难题,旁边配着机器学习团队随时接应。两组人绑在一起。
每一轮实验的成绩怎么算。不只看做出了多少个能用的分子,更看模型从这一轮里学到了多少。这才是重点。
传统实验室的逻辑是先有假设,再设计实验去验证。这里反过来。
实验首先是给模型出的练习题,按“先设计,再构建,然后测量,最后复盘”的循环一轮轮转下去。
每轮结束,机器学习团队会挑出模型最没把握、最可能学到新东西的那批序列,定下一轮测什么。测完的数据回流给模型,模型更新后再吐出下一批设计。一轮接一轮。
目标是让每次实验带回的信息量最大,而不是尽快凑出一个成品。信息量优先。
这套循环和 AI编程 里的模型迭代是同一个道理。先大量生成,再用结果反哺下一轮。逻辑相通。
过去是人指挥实验台。现在,实验台开始听模型的安排。

造自然界没有的蛋白,他早就做到了
这不是一个“模型造出了自然界没有的蛋白质”的故事。故事不是这样。
这件事,贝克早在 23 年前就做到了。
2003 年,他的团队用一款叫罗塞塔的软件设计出代号 Top7 的蛋白。93 个氨基酸,折叠方式在当时所有已知蛋白里都找不到先例。先例为零。
罗塞塔不是今天意义上的 AI小工具。它要人手动挑参数,一轮设计下来耗时不短。那是另一个时代。
2024 年的诺贝尔化学奖,一半给了计算蛋白质设计的贝克,另一半给了预测蛋白质结构的哈萨比斯和江珀。

如果说阿尔法折叠解决的是读,预测这串氨基酸会折成什么形状。那么贝克解决的就是写,为了实现某个功能,我该造个什么形状。
读的那一半这几年被推上了神坛。它靠的是人类已经攒好的数据。
写这一半没这个便宜可占。写要难得多。自然界没有的东西,数据库里根本查不到,只能自己造出来,自己测出来。
于是它一直卡在一个现实的泥潭里。一卡就是二十年。
模型一晚上能吐出几十万个候选设计,传统实验室一年做几百个就算高产。
设计与验证之间巨大的落差,才是这个领域一直难以击穿的天花板。落差就是天花板。
用贝克的话说,这个项目真正的突破,是模型的速度第一次开始匹配合成生物学的实验能力。
一边一天生成几百万个候选设计,另一边一管子测掉几百万个。这两只齿轮终于咬合上了。量级对上了。
不追通用大模型,重仓实验基础设施
当大家都在追一个能回答所有问题的通用大模型时,贝克和这家机构选了另一条路。
做一批只管具体难题的小模型,再为每个问题专门造出海量新数据去喂它。路线就此分岔。
道理不难懂。自然进化留下的样本,只是它在几十亿年里试出来的一小撮。拿这一小撮去学普适的设计规则,本来就有很大的缺口。缺口很大。
要补上这个缺口,就得缺什么数据、自己造什么数据。而造数据这件事不能靠堆显卡,要靠试管、测序仪和实验台。
上一阶段大家抢的是算力基础设施。下一阶段要抢的,是实验基础设施。抢的东西换了。
更反直觉的是,这局哪怕押赢,成果也全都白送。模型公开,数据集公开,实验方法公开,连试剂和基准一起送。赢家也白送。
万一别人拿这些数据做出了赚钱的药怎么办。
总裁科斯塔说得很轻松:“如果有很多公司拿这些数据去把世界变好,那是我们的运气。”这话说得轻松。
这条产线不是面向用户的 AI工具。它输出的是一串序列,真正干活的是试管和测序仪。重资产在实验台。
狂飙之下也有隐忧。批量制造自然界不存在的分子,必须防范意料之外的生态影响和恶意滥用。
这条链上有个绕不开的环节,就是合成 DNA。设计画得再多,最后总得有人把它做成实物。这一步绕不开。
守在这里的是行业的筛查系统。你下单合成一段 DNA,系统会拿它去比对已知的毒素和病原体基因,对上了就拦下。对上就拦。
2025 年 10 月发表在《科学》上的一项研究显示,微软团队用公开的蛋白设计工具,把 72 种受关注蛋白改写成约 7.2 万条合成同源序列。结构和功能大体保留,序列却面目全非。四款筛查软件大量漏检。打的就是这个空档。

该团队随后联合四家合成公司打了补丁,检出率大幅回升。补丁补上了。
问题在于,补丁只能补已经发现的那个漏洞。设计能力在指数级往前走,守门人却始终在后面追。差距在拉大。
贝克给出的主张是,所有人工合成的 DNA 都做登记留档。记录序列,也记录下单的人。门槛不高。
他认为这是一道实际可行的防滥用门槛。
赌局已经下注。
科斯塔给的时限是 18 到 24 个月拿出真正的进展,五年内开放给全世界的研究者。时间给得很紧。
贝克的愿望清单上写着,一种新疾病的疗法几周而不是几十年就能做出来,海里的塑料被酶吃掉,生物计算机的耗电远低于硅芯片。清单很长。
这些都还只是方向。贝克自己也承认,这条路上会先冒出一批能用、却说不清为什么能用的分子。
造得出来,讲不清楚。
达尔文曾用“无尽之形最美”惊叹自然的多样性。但在贝克看来,那些最美的形式只是几十亿年里试出来的一小撮。抽屉里绝大多数格子还没打开过。抽屉还很大。
现在,他借着模型把抽屉拉开了。一次翻六百万格。
