大语言模型能写诗、能编程,但一进工厂车间就犯难。高维结构化数据没法被塞进文本世界,硬转写就会丢信息。清华大学崔鹏教授团队与稳准智能给出的答案,是干脆绕开这条路——他们发布的结构化数据基础模型 LimiX-2,在 TabArena、TALENT 和 BCCO 等国际基准测试的分类与回归任务中均位列第一。
LLM 和 LDM 不在同一个信息空间里
两者的差别不在参数规模,而在维度。LLM 处理的是经过人类抽象和语义化的文本世界,LDM 则直接进入高维数据空间,学习变量之间的稳定关系。
把生产数据转写成文本,中间必然有损耗。LimiX-2 选择不转写,从变量关系本身出发理解规律。用团队的话说,LLM 主要学习人类已经表达出来的世界,LDM 更希望直接进入真实世界留下的高维数据空间。
从预测 Y 到建模所有变量
TabPFN 等路线的核心是预测 Y,一切围绕目标变量展开。LimiX-2 走的是另一条路:引入上下文机制网络(CMNs),把变量间的联合依赖结构本身当作学习对象。
这意味着模型理解的是数据生成机制,而不只是表面相关性。结构化数据建模由此从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题。
配套的技术是上下文条件掩码建模(CCMM)。通过不断遮蔽和预测不同变量,模型被强制学习变量间的条件依赖,再配合大规模合成数据引擎,提升在复杂分布下的鲁棒性。
这套组合的效果体现在榜单上:
- TabArena 分类与回归任务,Elo 评分均位居第一
- TALENT、BCCO 等国际主流基准测试,同样位列第一
- Sachs 等因果发现数据集上,表现超越传统方法
因果发现任务上的表现,是这条技术路线有效性的一个侧面验证。预测得准和理解了机制,是两件事。
第一不是终点
团队对成绩的表述相当克制:真正重要的,从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。
这句话指向的目标更大——让大模型从理解人类已经表达出来的知识,进一步走向理解世界运行本身。谷歌、亚马逊等巨头正在 AGI 方向上激战,而这条从结构化数据切入的路径,提供的是另一种进入方式。
热门跟贴