AI 快讯小米开源TabLDM,表格模型进入基础模型时代
模型上新

小米开源TabLDM,表格模型进入基础模型时代

2026-09-05T04:04:29.240Z
小米开源TabLDM,表格模型进入基础模型时代

小米今日开源通用表格数据基础模型 Xiaomi-TabLDM,依靠合成数据预训练、双流特征分组和稀疏混合专家,实现分类与回归任务的跨数据集直接预测。在四大公开基准中进入第一梯队,并拿下 OpenML-CTR23 回归榜第一。

小米开源 TabLDM,表格模型进入基础模型时代

小米今天(2026 年 9 月 5 日)发布并开源了通用表格数据基础模型 Xiaomi-TabLDM。它的核心卖点很明确:面对新的表格数据集,开发者不必像过去那样为每一张表重新训练、调参和做模型集成,直接把带标签样本作为上下文交给同一个预训练模型,就能完成分类和回归预测。

Xiaomi-TabLDM 是一个面向结构化数据的跨任务预训练基础模型,目标是在不针对单个数据集重新训练的情况下完成表格预测。 这也是它与传统 XGBoost、LightGBM 以及常见表格神经网络最本质的区别:后者把每个数据集视为一个独立项目,TabLDM 则试图把不同数据集放进同一个通用预测范式里。

从公开评测结果看,TabLDM 不是靠概念包装出来的产品。在 TALENT、TabArena、BCCO 和 OpenML-CTR23 四个公开基准中,它都处于第一梯队;其中回归任务表现尤其突出,在 OpenML-CTR23 回归榜排名第一,在 TALENT、TabArena 和 BCCO 的回归任务中均排名第二;在 TALENT 二分类任务中同样排名第一。

Xiaomi-TabLDM 表格基础模型的预训练、上下文学习与预测流程示意图

表格数据,为什么需要基础模型

表格数据是由行、列和字段类型组成的结构化数据,金融交易、医疗记录、工业参数和物流订单都属于这一类数据。 它不像文本或图像那样容易通过互联网规模化收集,但却是企业生产系统里最常见、也最直接影响决策的数据形态。

银行要判断一笔贷款是否违约,医院要预测患者的风险等级,制造企业要根据原材料和工艺参数预测产品性能,物流公司要估计配送时效。这些问题最终往往都落在一张 CSV、数据库表或数据仓库宽表上。

过去,处理这类任务的主力并不是大模型,而是 XGBoost、LightGBM、CatBoost、随机森林和各种专门设计的表格神经网络。它们在单个任务上可以很强,尤其是 XGBoost 一类梯度提升树模型,至今仍然是许多工业团队的默认基线。

问题在于,这种强大通常是以项目制交付为代价的。每换一个数据集,团队就要重新处理缺失值和类别特征,重新划分训练集与验证集,重新搜索学习率、树深、正则化参数,再决定是否使用多个模型进行集成。模型上线后,还要维护数据版本、特征版本、训练脚本和推理服务。

这套流程在一个数据集上并不算昂贵,但当企业同时维护数十个甚至数百个预测任务时,训练和管理成本会迅速累积。更麻烦的是,很多工业数据集的样本量并不大,单个任务很难支撑复杂模型稳定学习。

TabLDM 试图把大模型领域的预训练范式迁移到表格世界:先用大量不同分布的数据训练一个通用模型,再让模型通过上下文样本理解当前任务。换句话说,模型不再只学习某一张表里的规律,而是先学习不同字段、变量关系和预测目标之间可能存在的通用模式。

一次预训练,跨任务预测

上下文学习是指模型根据输入中同时提供的示例样本,临时理解当前任务并直接生成预测结果,而不更新模型参数。 Xiaomi-TabLDM 的公开说明显示,开发者可以把下游数据集中的带标签样本作为上下文输入,由单个预训练模型完成预测。

这更像是给一个有大量经验的分析师看一小批历史数据:分析师不需要重新上课,也不必为每个项目重新训练大脑,而是根据字段分布、样本关系和标签变化判断当前问题属于哪类预测任务。TabLDM 想做的,就是把这种任务识别和规律迁移能力固化进模型。

它目前覆盖两类核心任务:

  • 分类任务:预测样本属于哪个类别,例如是否违约、是否合格、设备是否故障。
  • 回归任务:预测连续数值,例如材料强度、零件重量、生产组分或配送时长。

需要注意的是,免重新训练不等于对任何数据都不需要数据准备。表格字段仍然需要按照模型要求进行整理,训练样本和标签也必须保持正确对应。TabLDM 降低的是每个任务都要重新拟合一套模型的成本,而不是取消数据清洗、字段理解和业务验证。

这一区别很重要。对开发者而言,TabLDM 的价值首先体现在模型工程环节:同一个预训练模型可以作为多个表格任务的统一入口,减少为每个数据集维护独立训练管线的需要。对于数据量较小、任务变化频繁的场景,这种方式可能比从头训练更有吸引力。

三层设计:合成数据、混合专家和推理扩展

TabLDM 的技术路线主要集中在预训练数据、模型架构和推理策略三个层面。

用结构因果模型生成预训练数据

结构因果模型(SCM)是一种用变量之间的因果关系和生成机制描述数据分布的数学模型。 小米没有简单地把有限的真实表格数据拼接起来训练,而是使用基于 SCM 生成的大规模合成数据进行预训练。

合成数据的关键不在于样本数量本身,而在于能否覆盖足够宽的数据分布。按照小米披露的信息,预训练数据覆盖了不同的数据规模、变量类型、依赖关系和函数关系。

这相当于为模型准备了大量风格不同的模拟题:有的表格样本很少,有的字段很多;有的变量之间接近线性关系,有的关系更复杂;有的任务包含类别变量,有的任务主要由连续数值构成。模型在这些变化中学习的不是某张表的固定答案,而是如何从有限上下文中识别数据规律。

这种做法也回应了表格基础模型最难的问题:真实世界的表格数据高度碎片化,而且通常涉及隐私和商业机密,难以像网页文本那样直接汇总。基于 SCM 的合成数据提供了一种可控的训练材料,研究者可以主动改变变量关系和任务难度,扩大预训练任务分布。

但合成数据也有边界。如果生成机制与真实工业数据之间存在明显偏差,模型可能在基准测试上表现良好,却在某些业务分布中失效。因此,TabLDM 的工业结果值得关注,但仍需要更多跨行业、跨时间和分布变化条件下的独立验证。

双流特征分组:同时看局部和全局

双流特征分组(dual-stream feature grouping)是一种从不同粒度组织表格特征关系的架构设计。 表格中的字段不像文本 token 那样天然具有顺序,模型既要理解单个字段的作用,也要捕捉多个字段之间的组合关系。

例如,在材料性能预测中,单看温度或压力可能不足以判断结果,但温度、压力、原料配比和加工时间的组合可能决定最终性能。模型需要同时处理字段级别的局部信号,以及跨字段的整体关系。

双流设计可以理解为两条并行的信息通道:一条关注更细粒度的特征组合,另一条关注更高层次的数据结构。这样的组织方式有助于避免模型只盯着少数强相关字段,也避免在字段数量变多后完全丢失全局关系。

轻量级注意力残差与稀疏混合专家

轻量级注意力残差(lightweight Attention Residual)是一种以较低计算开销增强特征信息传递的机制。 它的目标不是堆叠更重的注意力模块,而是在保持效率的同时,让不同层和不同特征粒度之间的信息更顺畅地流动。

稀疏混合专家(sparse Mixture-of-Experts,MoE)是一种只激活部分专家网络来处理当前输入的模型架构。 与所有参数同时参与计算不同,MoE 可以扩大模型总容量,但让每个样本只路由到少量专家,从而在性能和推理成本之间取得平衡。

放到表格任务里,不同数据集可能需要不同的建模偏好。金融数据可能更依赖稀疏且高维的特征关系,工业数据可能更依赖连续变量之间的函数变化,医疗数据则可能包含大量类别字段和缺失值。稀疏专家的意义在于,让模型有机会形成不同的数据处理路径,而不是用同一套参数硬套所有任务。

这三项设计共同指向一个目标:让模型拥有更大的任务覆盖范围,同时避免把所有计算成本都转移到推理阶段。对于需要批量处理多个表格任务的团队,这种效率考量比单一榜单上的最高分更接近实际部署价值。

Test-Time Scaling:把计算量留到预测阶段

Test-Time Scaling 是指在模型参数保持不变的情况下,通过增加推理阶段的计算量来提升输出质量。 在大语言模型中,这通常表现为让模型进行更长的思考或生成多个候选结果;TabLDM 则把类似思路用于表格预测。

对于表格任务,推理阶段的额外计算可以用于更充分地分析上下文样本、探索不同预测路径,或者对多个结果进行更稳健的汇总。它的优势是无需重新训练模型,开发者可以根据任务重要程度和可接受延迟动态调整推理预算。

当然,Test-Time Scaling 不是免费的性能提升。推理计算量增加,意味着延迟和算力成本也会上升。如果一个在线风控系统要求毫秒级响应,增加推理预算可能并不现实;如果是每天运行一次的材料配方优化或质量分析任务,额外计算就更容易被接受。

因此,TabLDM 的实际使用方式可能不是固定配置下追求所有任务的最高分,而是根据场景选择不同的推理档位:普通预测使用较低预算,高风险或高价值预测使用更高预算。这种弹性是基础模型相较于传统单任务模型的一个重要潜力。

四大基准表现:回归是它的强项

从小米公布的结果看,TabLDM 在多个公开基准中保持了较稳定的竞争力。

| 评测基准或任务 | Xiaomi-TabLDM 表现 | 结果解读 | |---|---:|---| | OpenML-CTR23 回归 | 第 1 名 | 回归能力达到榜首 | | TALENT 回归 | 第 2 名 | 进入第一梯队 | | TabArena 回归 | 第 2 名 | 性能与效率兼顾 | | BCCO 回归 | 第 2 名 | 在另一套回归评测中保持领先 | | TALENT 二分类 | 第 1 名 | 分类任务同样具备竞争力 |

这里最值得注意的是回归表现。表格基础模型往往更容易在分类任务中借助类别边界取得不错结果,但连续数值预测需要模型更准确地理解变量之间的函数关系,对分布外样本也更敏感。TabLDM 在 OpenML-CTR23 回归榜拿下第一,说明它的预训练数据和架构设计至少覆盖了相当一部分连续值预测规律。

效率数据也比较有说服力。以 TabArena 回归任务为例,TabLDM 获得第二高的 Elo 评分,但训练时间比排名第一的 TabFM 减少 82%,预测时间减少 68%。换算来看,如果 TabFM 的训练时间是 100 分钟,TabLDM 约需要 18 分钟;如果 TabFM 的预测时间是 100 秒,TabLDM 约需要 32 秒。

Elo 评分原本用于衡量国际象棋选手之间的相对实力,在这里被用于表达模型在基准测试中的相对排名。它不是准确率或均方误差本身,但适合用来比较多个模型在不同数据集上的整体胜负关系。

需要避免的误读是:排名第二不代表在所有数据集、所有指标上都优于传统方法,也不意味着它已经取代 XGBoost。更准确的结论是,TabLDM 在不针对每个任务反复训练的前提下,取得了接近甚至领先传统专用方案的基准表现,同时训练和预测耗时更低。

工业场景的结果,比榜单更重要

公开基准证明模型具有通用性,工业验证则决定它是否真的有落地价值。小米披露了三个真实场景的结果,分别涉及材料性能、零件重量和生产组分预测。

在材料性能预测场景中,TabLDM 无需微调即可将预测精度提升 130%,并减少约 90% 的无效试模与装机测试。这里的意义不只是模型分数更高:在制造业里,一次试模或装机测试往往需要消耗材料、设备时间和工程人员排期。如果模型能在前置阶段筛掉更多低价值方案,收益会直接体现为研发周期和试验成本下降。

在零件重量预测场景中,相比 XGBoost,TabLDM 将失误样本比例降低约 31%。这说明它的优势不一定只体现在平均指标上,还可能体现在对极端样本或复杂工况的处理上。对于制造质检和工艺控制而言,少量高风险失误有时比整体平均误差更值得关注。

在生产组分预测场景中,小米披露 TabLDM 的平均误差相比 XGBoost 更低,但公开资料未给出完整的绝对数值和实验设置。这个结果可以作为积极信号,但不能直接外推为所有生产预测任务都能获得同等收益。工业数据的采样周期、标签延迟、传感器漂移和工况变化,都会影响最终表现。

更有价值的地方在于,三个场景都强调了跨工况适应能力。传统模型通常在训练分布稳定时表现很好,一旦原料、设备或环境发生变化,就需要重新训练或重新调参。基础模型的目标则是让模型从更丰富的任务分布中学习,在新工况下少依赖人工干预。

TabLDM 和 XGBoost,应该怎么选

XGBoost 是一种基于梯度提升决策树的集成学习算法,擅长在结构化数据上通过多棵树逐步修正预测误差。 它成熟、易解释、工具链完整,仍然适合许多数据量充足、任务相对稳定且对低延迟要求较高的场景。

TabLDM 的优势主要出现在另一类问题上:数据集规模有限、任务数量多、字段关系复杂、分布经常变化,或者团队不希望为每个任务维护一套训练和调参流程。

| 对比维度 | Xiaomi-TabLDM | XGBoost | TabFM 等表格基础模型 | |---|---|---|---| | 使用方式 | 预训练模型结合上下文样本直接预测 | 通常需要针对数据集训练 | 依赖具体模型实现和任务流程 | | 是否需要逐任务调参 | 目标是无需重新训练和调参 | 通常需要 | 通常需要一定适配 | | 分类任务 | 已在 TALENT 二分类中排名第一 | 单任务表现成熟 | 视基准和实现而定 | | 回归任务 | OpenML-CTR23 第一,多个基准第二 | 工业基线强 | TabArena 中 TabFM 排名第一 | | 训练效率 | TabArena 回归训练时间比 TabFM 少 82% | 单任务训练通常较快 | 取决于模型规模 | | 预测效率 | TabArena 回归预测时间比 TabFM 少 68% | 适合低延迟推理 | 取决于推理策略 | | 分布变化适应 | 目标是增强跨任务、跨工况泛化 | 变化明显时常需重训 | 取决于预训练覆盖范围 | | 可解释性 | 需要额外分析方法 | 特征重要性和树结构较直观 | 通常弱于树模型 |

这张表也说明,TabLDM 不是对 XGBoost 的全面替代。XGBoost 的工程成熟度、可解释性和部署生态仍然是强项。更合理的做法是把 TabLDM 当成新的通用候选模型:在任务规模大、数据分散或跨工况明显的系统中优先测试;在稳定、低延迟、强可解释的任务中保留树模型作为基线或兜底。

开源对开发者意味着什么

小米此次开源的实际价值,不只是多了一个模型仓库,而是提供了一套可被复现实验和二次研究的表格基础模型路线。开发者可以从官方 GitHub 仓库了解模型说明、使用方式和相关文件,研究者也可以围绕预训练数据生成、上下文长度、推理预算和真实数据泛化能力继续验证。

对于 AI 应用团队,TabLDM 更适合作为表格预测层接入现有数据流程,而不是直接替代数据仓库或特征工程系统。部署前至少需要关注以下问题:

  1. 字段类型是否匹配。 连续字段、类别字段、缺失值和高基数字段的处理方式,会直接影响模型输入质量。
  2. 上下文样本如何选择。 如果带标签样本不能代表当前数据分布,模型的上下文学习就可能被误导。
  3. 推理预算是否可接受。 Test-Time Scaling 能提升预测质量,但也会带来额外延迟和算力成本。
  4. 是否建立传统模型基线。 新模型必须与 XGBoost、LightGBM 或现有业务模型在同一数据切分和指标下比较。
  5. 如何监控分布漂移。 表格数据的字段含义、采样方式和业务规则可能随时间变化,基础模型也不能绕过线上监控。
  6. 高风险决策是否保留人工复核。 医疗、金融和工业安全场景不能只依据单一模型输出做最终决策。

开源还会带来一个更长周期的检验:社区能否在真实数据上复现小米的结果,能否发现模型在特定行业中的短板,以及模型是否支持更广泛的任务形式。对于表格基础模型而言,这些问题比一次发布会上的排名更重要。

我们怎么看:表格领域终于有了值得观察的基础模型样本

TabLDM 最值得肯定的地方,是它把表格机器学习从“一表一模型”的项目模式,推进到了“一次预训练、跨任务使用”的基础模型路线。它没有依赖语言模型的叙事,而是针对表格数据的变量关系、任务分布和推理成本做了专门设计。

从结果看,回归是它目前最突出的标签。OpenML-CTR23 回归第一,以及在 TALENT、TabArena、BCCO 回归任务中的稳定排名,说明模型并非只在分类场景里有效。训练时间减少 82%、预测时间减少 68%,则让它具备了一定的工程吸引力。

但 TabLDM 仍然需要经过更严格的真实世界检验。第一,工业数据往往比公开基准更脏,缺失、漂移和标签延迟都会放大模型的不确定性。第二,免调参的便利性需要与可解释性、稳定性和合规要求平衡。第三,Test-Time Scaling 带来的性能收益,必须结合线上延迟和算力账单计算,而不能只看离线分数。

因此,现阶段对 Xiaomi-TabLDM 最准确的判断是:它不是传统表格模型的终结者,但已经是结构化数据基础模型赛道中一个相当有分量的开源样本。对于需要同时处理大量分类、回归任务的开发团队,尤其是数据量有限、工况变化频繁的制造、金融和供应链场景,TabLDM 值得进入正式的 A/B 测试名单。

表格数据不会因为大语言模型兴起就消失。相反,当企业开始把更多业务决策交给 AI,能否低成本、稳定地理解这些表格,可能比模型能否写出一段漂亮文本更接近真实生产力。小米这次开源,至少让这个方向有了一个更清晰的技术坐标。

参考来源

相关推荐

查看全部