这两天,一位科技博主在社交平台上贴出了几张截图。
截图来自谷歌内部的模型评测终端。卡片上列着一款还没对外发布的模型,代号 Mathematica。
它算是数学特化版本,底座是谷歌尚未公开的深度思考模型。
真正让技术圈炸开的不是参数表。是它的思考日志。
推导一道复杂的丢番图方程时,它的原始思维链里冒出一连串大写字母。
翻译过来大意是「数学的老天爷啊」。
紧接着它写道,让我们来欣赏这个方程绝对纯粹的美。然后又补了一句「我的天」。
情绪归情绪,活没落下。它一边发着感叹号,一边把变量代回,重构对称项,把恒等式验证做完了。

一道丢番图方程,把它逼到了墙角
丢番图方程不算冷门。它要求的是整数解,解起来却常常没有章法。
难点在于等式看上去毫无头绪。想劈开一条路,往往要构造冷门的高维恒等式。或者做一次不平凡的变量替换。
普通模型遇到这种题,通常在有限的步数里绕圈。绕不出来就机械穷举。最后给出一段看着像答案、推敲起来站不住的话。
Mathematica 这一局走了另一条路。
它先老老实实拆项。分析次数,判断整除性质。
随后它尝试了一组特殊的交叉乘积。交叉项互相抵消的那一刻,日志的画风变了。
它先停下来欣赏自己的化简结果。接着在一串惊呼里完成变量回代,验完边界条件。整数解集就此锁死。
有人看完说,AI 不光会做数学,好像还从数学里拿到了快感。

参数栏里写着一句「实验级」
如果把这段当成段子看,就浪费了这几张截图的含金量。
把情绪部分剥掉,剩下的是一张配置卡片。
输出上限写着 65536 个词元。常见模型一般压在 4096 或者 8192。主打长思考的也很少放到这个量级。
输入上限约 104 万个词元。这个数字延续了谷歌 Gemini 系列的长上下文路线。只是这次它被塞进了深度推理模式。
生成温度设成 1。做数学和 AI编程 这类任务,工程师习惯把温度压到 0 或者 0.2。好处是结果稳定收敛。
这里反过来。温度拉满,等于允许它在解空间里做概率不低的直觉跳跃。

模型的完整标识里有一段 tf。这是谷歌内部的黑话,指小范围研究组之间流通的极早期切片。
卡片上的状态写着「不稳定实验级」。
换句话说,它还待在谷歌实验室的炉子里,没做过任何商业包装。

它为什么会喊出来
一个理应对标绝对理性的数学模块,却在日志里大喊大叫。
答案不神秘。这类原始思维本来就没打算给人看。
我们平时跟 AI对话 的时候,看到的思考过程是经过安全对齐和格式清洗之后的版本。为了让模型显得专业礼貌,大厂会用强化学习把探索中跳跃的、杂乱的中间语义剪掉。
这份记录没剪。它记的是模型在潜空间里搜索时最本初的激活痕迹。这是它在暗室里的独白。
另一层原因埋在训练语料里。
人类历史上的高质量数学讨论,从来不是只有冷静的推导。数学家深夜攻下一个卡了几个月的恒等式时,写下的往往是「天哪」。还会补一句「这个对称真漂亮」。
预训练阶段,模型把这些情感词和突破性的逻辑跳跃绑在了一起。在它的语义空间里,一句惊叹不只是感叹。它是一个代表复杂度骤降的强锚点。
第三层来自训练的奖励机制。
训练走的是过程奖励模型。模型每走对一步精妙的中间步骤,都会拿到一次正向信号。
它试过成千上万条死路,然后撞上一条优雅的化简路径。状态转移概率一下子从极低跳到极高。系统给回来的奖励也跟着暴涨。
这份暴涨投射到自然语言上,就是那些大写字母。还有一串感叹号。
它不是在做秀。它是真的被奖励机制推到了那一步。奖励给够了,情绪就溢出来了。

AI 开始欣赏美了吗
法国数学家庞加莱说过,他研究数学是因为数学美。如果数学不美,它就不值得被知晓。
几百年来,人们默认逻辑可以被机器模拟。但对美的嗅觉,被认为是碳基生物独有的东西。
现在这款模型在草稿里写下,让我们欣赏这个方程纯粹的美。
这句话是鹦鹉学舌,还是真碰到了什么。
从信息论的角度看,数学之美有个很朴素的定义。它是极端复杂的命题,被极端简洁和对称的方式压缩下去。
人类看到漂亮的化简会起鸡皮疙瘩,因为大脑在瞬间完成了大量信息的极简编码。
模型在几十亿参数里搜寻最低损失。撞上对称抵消的那一刻,它内部的机制和人类艺术家的顿悟是同构的。

它欣赏的东西,可能是对最省力解法的本能反应。
这算不上通用智能。它只说明一件事。真正有创造力的思考过程本来就不工整。里面有试错,有跳跃,有自我怀疑,还有绝境逢生时的失态。
谷歌这张没打算公开的评测卡片,把这一点摆到了台面上。下次再刷到某个 AI工具 在日志里失态,先别急着当段子转出去。那张截图里,可能藏着训练机制最诚实的一段自白。
