2016 年 3 月,首尔四季酒店。
人机大战第二局走到中盘。
AlphaGo 把一颗黑子落在第五线上。
现场解说一时语塞。
有人怀疑程序出了 bug。
按职业棋手的常识,这一手几乎等于白送。

后来的事大家都知道了。
AlphaGo 赢下那一局。
总比分 4:1,李世石落败。
赛后他说了一段被反复引用的话。
他原以为对面只是台按概率计算的机器。
可看到那一手,他改了想法。
那台机器一定有创造力。
那就是著名的第 37 手。
十年过去,当年亲手造出它的人却站出来说了句相反的话。
那一手依赖的能力,今天的 AI 恰恰没有。

他叫格雷佩尔。
AlphaGo 的核心作者之一,长期研究机器学习。
最近他做了个耐人寻味的决定。
离开谷歌的 DeepMind,转去创业。
要做的事只有一件,给机器装上真正的推理能力。

观点出自他刚发在《麻省理工科技评论》上的一篇文章。
标题很直接,叫「别被骗了,大模型不会推理」。
图灵奖得主杨立昆表示赞赏。
他强调,真正的推理必须包含搜索,大模型没有这个能力。

我们来看看他到底写了什么。
第 37 手不是灵光一闪
很多人讲第 37 手,讲的是一个神话。
机器电光石火之间,看到了人类千年棋谱之外的妙手。
格雷佩尔说,这是对 AlphaGo 最大的误解。

要理解这一点,得先拆开 AlphaGo 的内部构造。
它有两套系统。
一套叫策略网络,学的是海量人类棋谱。
它负责预测,高手在这一局面会怎么下。
这是直觉的那一半。
另一套是搜索机制。
它不在乎某一手像不像人下的。
它会显式地建一棵博弈树。
分支数以千计。
每个候选落点通向的未来,都被逐一推演。
关键就在这里。
在策略网络眼里,第 37 手平平无奇。
职业棋手下出这一手的概率,大约只有万分之一。
只听直觉,它根本不会被选中。
是搜索机制算到最后,发现这手怪棋通向更好的终局。
格雷佩尔借了卡尼曼那个著名的框架。
人的思考分两种模式。
系统 1 快,凭直觉,毫不费力。
系统 2 慢,一步一步来,审慎权衡。
AlphaGo 恰好把这两种模式合在了一台机器上。
神经网络给出「这手有戏」的判断。
搜索机制再把这份判断放进未来的攻防里检验。
缺了哪一半都不行。
光有直觉,永远走不出第 37 手。
光靠硬算,也筛不动围棋那海量的可能性。
这里还有个常被忽略的对比。
1997 年深蓝击败卡斯帕罗夫,靠的是人类写死的规则。
它每秒评估 2 亿个局面,向前看六到八步。
围棋的复杂度完全是另一个量级。
一颗子的价值,取决于几十个回合之后厚势与实地的消长。
哪怕只算所有变化的一小部分,超级计算机也得算上几十亿年。
所以 AlphaGo 必须学会一眼看清局势。
甚至要走出人类从未想过的下法。
它不是靠算力碾压赢的,这一点很要紧。
大模型只是一个被练到极致的系统 1
再看今天的 AI。
大模型的工作原理,说到底是一遍遍预测下一个词元。
这本质上就是系统 1 在运转。
它快,靠联想。
在几乎所有人类写过的东西上,它都能给出漂亮的补全。
可它没有「想一想再回答」这个环节。
聊天机器人火起来之后不久,业界就发现光有语言流畅撑不起真正的用处。
补救方案大家都很熟。
让模型别急着回答。
先生成中间步骤,把问题拆开,把中间结果带下去。
这就是思维链。
思维链的提升是实打实的。
数学和 AI编程 上尤其明显。
但格雷佩尔点出一个常被兴奋盖住的事实。
这些中间步骤,仍然是同一个预测下一个词元的过程。
只是在给答案前多迭代了一会儿。
它没有像搜索机制那样,引入一个真正独立的推理环节。
直觉被拉长了。
可它并没有因此变得审慎。
他列出了三个短板。
说明眼下这批 AI对话 产品做的事,为什么够不上科学家承认的那种推理。
第一,模型没有一份明确的认知状态。
它此刻在考虑哪些假设。
对每种解释又抱多大信心。
它在权衡哪些证据。
还有哪些问题悬而未决。
这些本该随新信息被系统性修订。
可模型内部并没有这样一本开放的账簿。
第二,模型没有分开「知道什么」和「怎么用知识」。
知识和推理死死缠在神经网络的权重里。
不存在一套独立又显式表达的信念体系。
第三,也是最微妙的一条。
思维链看起来像深思熟虑。
可研究已经表明,模型经常在事后编造它们。
答案走的是一条路,报告给你的却是另一条。
一个听起来很有道理的故事,和一段真实发生的推理,是两回事。
推理是真是假,这事很要紧
如果只是闲聊,真假可能无所谓。
但在真正高风险的地方,这事很要命。
医疗,工程,科学研究。
一个系统得出什么结论,和它怎么得出结论,一样重要。
出了错,我们需要能定位错在哪一环。
是推理过程出了问题。
还是采信了无效证据。
或者是前提假设本身就站不住。
一个只会事后编故事的系统,在这里没法被信任。
也没法被追责。
宁可慢一点,也要留一条能查下去的线索。
这也正是格雷佩尔离开的原因。
他认为需要一条全新的机器推理路径。
灵感恰恰来自十年前的 AlphaGo。
AlphaGo 随时维护着一份它对自己局面的全部认知。
也就是那棵博弈树。
树里装着它考虑过的所有变化。
每个局面都标着神经网络的判断。
推演越深,这棵树就越新。
最后它综合树里的信息落子。
他认为,通用推理系统也该如此。
维护一个认知状态。
明确表达哪些已经确认。
哪些还存疑。
哪些已被排除。
哪些问题仍然开放。
而推理,就是一串改变这个认知状态的动作。
推导结论,拆解问题。
最要紧的,是决定下一步问什么。
算哪一步。
跑哪个实验。
当然,开放世界的推理比下棋难得多。
棋盘上状态完全可见,规则固定。
现实里,当前局面只被部分知晓。
可选的动作又多又杂。
行动的后果充满随机性。
甚至完全未知。
好消息是,这几年一批 AI工具 的进展,恰好给了这件事零件。
大模型能基于已知信息和手上的资源,提议解决问题的路径。
它能通过接口和代码跟工具打交道。
它也能帮着判断,一个论断有没有证据撑着。
最重要的是,系统里得有一个独立的裁判。
它按「这一步究竟消解了多少不确定性」来评估每个推理动作。
只有在证据支持时,才更新信念。
规则一旦立起来,系统就能攒下经过认证的知识。
还能从过去的推理经验里,改进自己的策略。
格雷佩尔给这幅图景起了个很形象的说法。
叫,打了兴奋剂的科学方法。
目标只有一个,产出经得起审视的知识。
文章最后,他把态度亮得清清楚楚。
靠把系统 1 做得更大,到不了可信任的机器智能。
规模能磨利直觉。
可它磨不出审慎。
第 37 手之所以重要,是因为一台机器守住了一个局面。
它称量过每一种可能的未来。
然后选中了那手连它自己的直觉都会否决的棋。
而社会恰恰需要更多这样的神之一手。
新药研发需要它。
材料设计需要它。
气候预测和疾病诊断也需要它。
那里的棋盘完全不像围棋。
甚至没人把规则递到我们手上。
这样的洞见,只会来自真正会推理的系统。
结论出自一段可审计的证据链条。
而不是一个事后编出来、听着很顺的故事。
十年前,AlphaGo 用第 37 手告诉世界,机器可以超越人类的直觉。
十年后,它的创造者之一在提醒我们。
别让流畅的语言骗了你。
那一次真正的飞跃,至今没有在大模型身上发生第二次。
争议:这套标准,人自己达标吗
这篇观点文发出后,X 上吵开了。
最犀利的质疑来自多伦多大学的杜弗诺。
他是一篇顶级会议最佳论文的作者之一。
他说,格雷佩尔给大模型定的三条罪状,放在人身上同样成立。
没有可检查的认知状态。
知识与推理不分离。
事后编造解释。
他反问,按这个标准,他自己算不算会推理。

格雷佩尔回应得很快。
你单靠自己推理不好。
给你纸笔,就好得多。
再让你严格遵循科学方法,才算得上出色的推理者。
诀窍从来不是跟着意识流走。
而是把过程结构化。
否则谁都逃不过认知偏差。

对方立刻抓住弦外之音。
照这么说,给大模型配上类似工具,按你的定义就能实现真正的推理。
这该不会正是你打算做的事吧。

这套纸笔增强论,还引来了别的质疑。
有一位网友指出,纸笔本质上是工作记忆的外挂。
它让你能同时推理更多数据。
可它并没有无中生有地改变推理能力。
不过它有个额外好处。
写下来的文字和数字,恰好就是认知状态可检查的证据。

紧接着,另一位网友问得更尖锐。
照这么说,人类推理就等于现有模型加外挂系统。
那你要建的,是一个内部推理能力比两者都强的模型。
还是他漏掉了什么细微差别。

对这些问题,格雷佩尔还没给出回复。
另一种声音则觉得这场讨论多余。
有一位网友直言,不敢相信还有人写这种文章。
大模型已经在太多事情上做得很好。
说它不会推理,要么可笑,要么无关紧要。
何况同类文章早发过几百篇。

格雷佩尔没纠缠,只把三个问题丢了回去。
在没有标准答案的领域,它们可靠不可靠。
有没有产出过硬的新科学理论。
你敢不敢让它决定自己的医疗方案。
对方倒也坦率,承认目前还都没有。
但把锅甩给了现有的强化学习方法,而不是大模型架构本身。
言下之意,假以时日都能解决。
这大概是两派人真正的分歧。
一方认为缺的是时间。
另一方认为缺的是架构。

还有条评论问出了很多人心里的八卦。
DeepMind 为什么不支持这项研究。
格雷佩尔的回答很直白。
前沿实验室都在押注规模。
可以审计的推理,无法单从规模里自己长出来。
它需要一种不同的架构。
有时候,激进的念头在大组织里反而更难落地。
提问的那位网友很失望。
在所有实验室里,他最期待 DeepMind 会是那个最努力找新路的人。

也有人把矛头指向更根本的地方。
有位评论者只留了一句话。
语言本身就是错误的工具,靠它做不出可靠的推理。
格雷佩尔认真接住了这个更激进的立场。
他顺势抛出一个开放问题。
推理确实需要某种知识表示。
如果自然语言太模糊,能不能改用形式化语言去推演现实世界。
那样的语言会长什么样。
他没有给答案。
但这或许正是接下来一些人创业要回答的问题。

