AGI新战场:谷歌亚马逊刚入场,中国LimiX-2已在LDM赛道连续登顶

3次阅读
没有评论

共计 1264 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

AGI 新战场谷歌亚马逊巨头激战, 杀出个中国 LimiX- 2 赢了又赢

当大语言模型的竞争还在持续升温时,另一条面向结构化数据的 AI 路线正在快速崛起。谷歌、亚马逊、SAP 等巨头相继入局, 而一支中国团队已经在这条赛道上连续拿下国际基准测试的头部位置。

📌 LDM:AGI 竞赛中被低估的另一条路线

LDM(Large Data Model), 即结构化数据基础模型, 瞄准的是生产侧的核心痛点: 让基础模型直接学习结构化数据中的变量关系、条件关系和生成机制。与 LLM 处理已经语义化的文本不同,LDM 面对的是工业、科研等场景中未经人类抽象的高维数据空间。

制造业中,温度、压力、转速、原料配比等数十到上千个变量同时变化, 其中大量关键规律并未被总结成规则或文本。如果先转写成文本再交给 LLM 处理, 中间的信息压缩可能恰恰丢掉决定预测精度和良率的关键细节。

🔍 巨头集体押注, 中国团队抢占先机

今年, 谷歌发布 TabFM,将表格数据基础模型纳入其 Foundation Model 版图; 亚马逊推出 Mitra, 探索预训练模型跨表格、跨任务的迁移能力;SAP 动作更为激进, 先推出 SAP-RPT-1, 又收购 TabPFN 背后的 Prior Labs, 投入超过 10 亿欧元扩建研究团队。

就在 SAP 抢发 TabPFN-3.5 几小时后, 由清华博士组成的团队发布了 400M 参数的结构化数据基础模型 LimiX-2, 在 TabArena、TALENT、BCCO 三个国际主流基准测试中, 二分类、多分类、回归等任务均位列第一。

这并非稳准智能第一次登顶。去年发布的国内首个结构化数据基础模型 LimiX 就曾长期霸榜。团队没有追着榜单跑, 而是继续往底层技术里扎, 这次 LimiX- 2 的发布再次让海内外主流选手措手不及。

💡 技术范式切换: 从预测目标到理解变量关系

与 TabPFN 等以目标预测为中心的行级建模路线不同,LimiX- 2 把面向变量关系建模前置为核心目标。团队提出上下文机制网络(CMNs), 将结构化数据建模从预测问题推进为面向全变量联合依赖和数据生成机制的关系建模问题。

配合上下文条件掩码建模 (CCMM) 和升级后的自动化数据合成引擎,模型在训练中不断被“换题”——遮住不同变量进行预测, 从而学习变量之间的条件依赖和联合结构。建模粒度也下沉到 Cell-Level, 保留列身份、具体取值和缺失状态。

📊 实测表现: 分类与回归任务双双领先

  • 分类任务:TabArena 评测中,LimiX- 2 四项指标均居第一,Elo 达到 1917, 领先 TabFM 143 分。
  • 回归任务:Elo 达到 2206, 位列第一, 体现对连续变量依赖关系的建模能力。
  • 对标模型: 超过 Google TabFM、TabPFN、TabICL、Mitra 等主流模型。

🚀 行业观察:LDM 能否补上 LLM 的缺口

LLM 已经吃透文本、语音、视频,但一碰到工业生产、科学研究等真正用来做决策的场景, 对因果关系、准确性和稳定性的要求会陡然提高。LDM 更希望直接进入真实世界留下的高维数据空间, 从变量关系本身出发理解规律。

以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码