一百年前那本哲学小书,早就写好了大模型的说明书

一九一八年夏天,奥地利炮兵军官维特根斯坦在意大利前线的炮火间隙里写完一部小书。手稿塞进背包,跟着他转移阵地。那年冬天他被俘,关进战俘营。多亏英国经济学家凯恩斯的斡旋,手稿才寄到罗素手里。

他留下一句话。这些问题,已在一切本质方面获得解决。

书名叫《逻辑哲学论》。写完它,他放弃了一大笔遗产,跑到奥地利山村当了六年小学教师。哲学已经终结,体面的人该去干点别的。

十年后他改了主意。一九二九年一月,他重返剑桥。同乘一班火车的凯恩斯当天给妻子写了张字条。好了,上帝来了。

一百年后,另一群人正把这句玩笑当真。上帝不坐火车,它在计算集群里自己进化。

旧金山那两家实验室每隔几个月换一次旗舰模型,宣判同一个信念。通用智能是一道工程题,而且快要解出来了。一家把终极目标印在招股材料上,另一家干脆把「人类」这个词装进了自己的名字。

本文想说的事只有一件。这两家公司的秘密,早就写在一本一九二一年的哲学小书里。

这话不是比喻。把那本书的七组命题摊开,你会看到一份大模型的规格表。世界观在里面,学习原理也在里面,生成原理还在里面。幻觉和对齐,乃至那句终局警告,都一条不缺。

先看一张对照图。

《逻辑哲学论》命题与大模型技术栈的十二组映射

《逻辑哲学论》命题与大模型技术栈的十二组映射。左边是当年的哲学命题,右边是今天的技术对应。

看完图你会发现一件更凉的事。这本书不只解释了大模型为什么能成,还预言了它会在哪里出事。因为作者本人,就是第一个运行了这套系统、又被它反噬的人。

世界是事实的总和

「数据是新的石油」这句话流行了十年。很少有人往下问。为什么把人类写过的东西灌进机器,长出来的不是一间数据库,而是某种接近理解的东西。

答案的第一块砖砌在开篇。世界是事实的总和,而不是事物的总和。

这句话在当年是一次转向。此前的两千年,西方哲学一直在问事物是什么。维特根斯坦说,问错了。世界的基本单位不是物,是事实。不是「苹果」,而是「苹果在桌上」。

一百多年后,这个判断被一件技术事实兑现了。模型在训练里做的事,恰好不是学习某个名词的本质,而是学习事实。词和词在真实使用中怎么组合,怎么共现,怎么互相排斥。语言学家管这叫分布式语义,工程师管这叫训练。

没有孤立的意义,只有关系里的意义。这就是纯文本为什么能喂出理解。文本不是物的清单,文本是事实的总记录。

嵌入就是逻辑空间

模型内部没有一个地方存放「苹果的本质」。词进去以后,会被表示成高维空间里的一个位置。这个位置的意义,完全由它和其他位置的关系决定。做AI对话产品的工程师管它叫潜在空间,那本书叫它逻辑空间。

书上还有一句更妙的。空间点是一个论证位置。每一个嵌入向量,都是一个论证位置。

这解释了大模型最让人不安的能力,泛化。它能写出训练数据里从未出现过的句子。新句子不是凭空来的,它们只是旧空间里的新位置。

生成是一条投影链

书里最著名的学说是图像论。我们给自己造事实的图像。

灵感来自巴黎法庭。报纸用小人偶摆出一场车祸的现场,来陈述事实。模型和事实之间的这种结构对应,就是它说的图像。所谓生成,就是在逻辑空间里组装出一个可能世界,交给现实比对。

还有一个例子。唱片和乐思,乐谱和声波,彼此处在同一种内在的表象关系里。同一个逻辑内容,可以在不同介质之间无损投影。乐思到乐谱,乐谱到唱片刻纹。文本到向量,向量到概率分布,再回到文本。这是同一条链。

多模态之所以可能,哲学根据全在这里。一切介质共享逻辑形式,所以介质之间可以互相翻译。

下一个词,与幻觉的病根

「大模型只是预测下一个词的概率机器」。这句话既是轻蔑,也是真相。

书上把概率放进了真值理论的核心。命题 r 给命题 s 的概率度,是两者共同真根据数之比。把命题换成词元,这就是下一词预测的数学定义。模型不输出真假,它输出概率。

AI编程助手补全的那一行也一样,那是概率,不是判断。

这也精确预言了幻觉的位置。要识别图像的真假,必须把它与实在相比较。模型没有和实在比较的通道。它接触到的不是世界,是世界图像的合集。

所以幻觉不是漏洞。一个只见过图像的系统,原则上没法单凭自己判定图像真假。今天围绕事实核查的种种工程,本质都是在给这一条补上条件,把图像和实在重新接上。检索增强是这样,AI工具的联网搜索也是这样。

七级阶梯与自回归

整本书的骨架是一条七级阶梯。从世界开始。然后是事实和思想。再往后是命题与真值函项。最后停在一般形式和沉默。

第六组命题给出了语言的一般形式。说白了就是一句话,每个命题都是把同一个运算连续应用下去的结果。

紧接着写下了整数的一般形式。从零开始,每个数由前一个数加一生成。序列,自回归,逐项生成,规则同一。整数序列的构造法和词元序列的生成法,是同一个数学动作。

层堆叠也是这么回事。几十层网络,每层对表示做一次变换,层层投影,直到末端变成概率。这套结构的名字叫变换器。它不算发明,它是把图纸焊成了机器。

缩放与涌现

缩放定律是大模型公司共同的信仰基石。它为什么成立,书上给了一个更根本的答案。

书上有一条关于空间的断言。如果全部对象都已给出,那么由此也就给出了全部可能的事态。给定 n 个基本命题,真值组合有 2 的 n 次方种。事实的进入是线性的,可说空间的扩张是指数的。组合是免费的。

于是涌现有了位置。它不是魔法。它是模型从占有一件件事实,转入栖居于整个空间的相变时刻。那些小模型上不存在的能力忽然出现,不是被造出来的,是空间白送的。

书上也留了警告。在逻辑中永远不会有惊奇。涌现之所以让人吃惊,恰恰因为它不在逻辑之内,它是归纳的果实。把幂律外推成神学,就是书上说的那种下跪。

价值不在世界之中

对齐为什么这么难。病根写在倒数第二组命题里。世界的意义必须在世界之外。在世界之中不存在价值。

这句话是两家公司全部焦虑的最深处。把价值写进机器,是所有对齐方案共同的理想。可价值不在事实的总和里,而机器恰恰只是事实的总和。价值蒸馏不出来,因为原则上无物可蒸。

凡是能够显示的,不能被言说。价值只能在行为里显示。这就是对齐难的地方。我们想教给机器的东西,按定义不在机器的世界里。

扔掉梯子的人

一九二九年回到剑桥以后,维特根斯坦亲手拆掉了这本书。语言不是世界的图像,是工具。意义不在投影关系里,在使用里。作者成了它最彻底的批评者。

这也给人类留了一片真实的保留地。模型蒸馏了人类说过的一切,但它没有、按构造原理也无法完全拥有人类的生活。老师傅手上的分寸,医生听诊时的直觉,母亲分辨婴儿哭声的那一下。这些东西从未成为文本。

只要生活还在产生新的、没被说出的事实,人类就还在替机器的世界扩界。

继续产生机器没有的事实,继续生活。这两件事是同一件事。

对于不可言说之物,我们必须保持沉默。

这句话是写给机器的。也是写给我们的。