这两年,大模型赛道卷得厉害。
大家的目光几乎都盯着那些能直接上手的AI工具。
可另一条做结构化数据的路线,最近突然挤满了巨头。
谷歌下场了。亚马逊也下场了。德国软件公司SAP动作更大,干脆把TabPFN背后的团队买了下来。
就在巨头们刚进场的时候,榜首的位置已经被人坐稳。
9月15日,SAP抢先发布TabPFN-3.5。
几个小时之后,一家中国团队出手了。模型只有400M参数,却拿下了三个国际主流基准的第一名。
模型叫LimiX-2,来自稳准智能。三个基准分别是TabArena、TALENT和BCCO。二分类、多分类和回归,任务都算了进去。
这不是稳准智能第一次站到头部。
去年他们发布的LimiX,是国内第一个结构化数据基础模型,也霸榜过很长一段时间。
有意思的是,榜单拿到手之后,团队没有守着名次继续刷分。他们转头扎进了底层技术。
与其追着榜单改模型,不如把学习目标换掉。这就是他们后来做的事。
大模型啃不动的数据分析,另一条路线接了过去
大语言模型这两年的能力涨得很快。
但热闹归热闹。当人工智能真正往产业深处走,一个被增长掩盖的问题开始露出来。
现实世界比语言世界大得多。
今天的大模型,能力基本建立在一个庞大的语义世界之上。
文本、代码和论文,还有被标注描述过的图片与视频,它们承载的知识有一个共同点。
这些知识都已经过人类的一次理解、筛选和抽象。
模型要做的事,就是把它们切成词元,再从海量语料里学上下文关系。
所以从建模对象看,这类模型处理的是已经完成「语义化」的现实。

但产业系统里,还有另一类数据长期待在语义层之外。
这不是那种装好就能用的AI小工具能解决的。
拿制造业来说。温度在变,压力在变,转速也在变。原料配比和设备状态同样在动。
同时变化的变量可能有几十个,多的能到上千个。它们一起构成一个持续演化的高维空间。
这里面的很多规律,人类并没有提前总结成规则、公式或者文本。
更关键的是,产业真正关心的不是某个变量等于多少。
它关心的是变量之间有没有稳定关系。哪些关系能跨环境成立。一个变量动了,整个系统会怎么响应。
如果先把这类数据转成文本,再交给AI对话系统,中间就必然经历一次信息压缩。
可在生产系统里,被压缩掉的细粒度差异,往往直接决定预测精度和风险判断。
在语义空间里可以忽略的东西,到了生产空间可能最值钱。
这就是结构化数据建模和语言建模最本质的差别。
前者学的是人类已经表达出来的世界。后者想直接进入真实世界留下的高维空间,从变量关系本身去找规律。
两条路线是平行的,也是互补的。

把学习目标从预测结果换成学关系
结构化数据模型继续往深处走,一个问题冒了出来。
我们想知道的不只是结果,还有变量之间怎么互相影响。
生产侧真正在意的,常常就是变量之间的关系,以及一个变量变化后其他变量怎么动。
问题就从这里开始。
到了这一步,传统路线的能力边界就显出来了。这类路线以目标变量为中心。
它通常先把数据压成更高层的表示,再用来做预测。这样做适配任务很快。
代价是部分变量级的细粒度信息,会在表示过程中被折叠掉。
这一步省不得。

问题从预测结果推进到理解变量关系之后,模型需要保留的信息粒度也跟着变了。

稳准智能这次动刀的地方,是结构化数据模型最底层的技术范式。
崔鹏是团队的首席科学家,也是清华大学计算机系教授。他长期研究结构化数据与因果智能,是这条路线最早的提出者之一。
团队想解决的问题是,怎么让模型越过表面相关性,找到那些跨环境依然稳定的关系。
于是LimiX-2没有沿着传统预测范式继续堆能力,而是改了模型「学什么」。
他们提出上下文机制网络,英文缩写CMNs。
这套机制换掉了建模目标。以前是以目标变量为中心做预测。现在改成面向全变量联合依赖的关系建模。
变量关系不再是为预测服务的中间信息。它变成了模型要学的核心对象。
这种切换有点像大语言模型从BERT走向GPT。
变的不是参数量,也不只是榜单分数,而是学习目标和组织信息的方式被重新定义了。

道理听着漂亮,做起来并不轻松。
既然想让模型搞清楚变量之间的关系,训练时就不能总给它同一道题。
所以团队提出了上下文条件掩码建模,还升级了自动化合成数据引擎,不断给模型换题。
做法是反复遮住不同的变量,再让模型去预测。
练得多了,模型就没法只围着某一个目标死磕,得把整张表里变量之间的关系摸清楚。
题换了,学的就多了。

除了训练目标,表示的粒度也往下沉了一层。
LimiX把建模单元下沉到了单元格这一级。列的身份、取值和缺失状态都保留下来。变量之间和样本之间还能互相交互。
这样一来,从数据表示到训练目标,再到网络计算,整套设计都围着联合依赖建模转。
分类、回归和缺失值填补这些任务,也就统一成了对同一个数据模型的不同查询。
三个部件构成一个闭环。
上下文机制网络负责把目标改成学关系。掩码建模负责让模型真的去学。单元格级的表示负责把细粒度特征留住。
成绩单:三项第一,Elo领先143分
新技术范式真正有价值的时刻,是它开始改写能力边界之后。
对结构化数据模型来说,比多刷一张榜单更重要的,是能不能把能力带进生产环境。
而在进真实场景之前,LimiX-2先在国际基准上把这条路线跑到了头部。
在TabArena、TALENT和BCCO三个基准上,LimiX-2的每一类任务都排第一。
二分类、多分类和回归,它一项没落下。
它超过了谷歌的TabFM和TabPFN,也超过了TabICL和Mitra。

先看分类任务。分类要回答的是「它属于哪一种状态」。
设备会不会故障。客户会不会流失。一笔交易有没有风险。
这三个问题的本质一样,都是让模型从大量变量里找出真正影响结果的信号。
在TabArena的评测里,按Elo排名,它的四项指标全部第一。Elo达到1917。比TabFM高出143分。
另一个考验底层建模能力的指标是回归。
回归要求模型进一步理解连续变量之间的依赖,再把这种关系压到一个足够准的数值上。
同样按Elo排名,它在回归任务上的四项指标也是第一。Elo是2206。
换句话说,它的优势不只是分得对,在连续关系的建模上也更细。
成绩的提升还有数据侧的一份功劳。
学习目标扩展到变量关系建模之后,对训练数据多样性的要求也跟着提高了。
所以LimiX-2升级了自动化的合成数据引擎。它覆盖了更多分布、交互关系和噪声类型。
这样做是让模型提前见过更丰富的数据结构。

除了分类和回归,LimiX-2也开始往因果发现上走。
面对高维复杂数据,传统方法往往受专家先验和统计假设的限制。
而在一些公开数据集上,LimiX-2已经领先多种传统因果发现方法。

分类任务和回归任务,还有跨数据泛化,都是企业的日常活。
这类榜单真正检验的,是模型面对真实数据时能不能稳定预测、迁移并支撑决策。
这背后指向的,是结构化数据模型更长的一条能力路径。
从预测走向关系,再走向因果、干预和决策,最终指向通用因果智能。
最后说两句
2020年,GPT-3问世。
行业第一次看清了一件事。基础模型一旦跨过能力临界点,人工智能就可能从单点任务走向更通用的智能。
六年过去,通用人工智能已经从一个遥远的概念,越来越接近一场可以被实现的愿景。
但它终究要进入一个比语言世界复杂得多的空间,也就是真实世界本身。
理解变量如何彼此作用。理解因果如何层层传导。理解一个微小的变化,最后会把整个系统推向哪里。
这正是结构化数据模型指向的地方。
别小看这一次换目标。它让大模型从理解人类已经表达出来的知识,走向理解世界运行本身。
在这条可能决定下一阶段能力上限的赛道上,已经有中国团队走到了头排。
参考链接:
技术报告:https://arxiv.org/abs/2609.17488
开源代码:https://github.com/limix-ldm-ai/LimiX
模型地址:https://huggingface.co/stable-ai/LimiX-2
