
这篇论文介绍了TabICLv2一个在表格数据上用于回归和分类的新型最先进SOTA表格基础模型TFM。其核心研究内容可以概括为以下几个主要方面1. 研究目标与核心贡献目标构建一个性能超越现有最先进模型如经过调优、集成和微调的 RealTabPFN-2.5、同时更快、可扩展性更强且完全开源的表格基础模型。三大支柱新颖的合成数据生成引擎用于高多样性的预训练。架构创新包括新的可扩展 softmax 注意力机制QASSMax无需超长序列预训练即可泛化到更大数据集。优化的预训练协议用 Muon 优化器替代 AdamW并改进预训练流程。开源承诺发布推理代码和模型权重后续将发布合成数据引擎和预训练代码。2. 架构创新重复特征分组通过循环移位将每个特征放入多个组中避免表示崩溃同时保留细粒度特征信息。目标感知嵌入在早期阶段将目标信息直接注入所有特征嵌入中有助于缓解表示崩溃。先压缩后 ICL 流程采用列嵌入、行交互、数据集级 ICL 三阶段保持的运行时复杂度。查询感知可扩展 softmax (QASSMax)扩展 SSMax通过基础缩放和查询感知门控来锐化注意力分布缓解长上下文中的注意力衰减问题显著提升大尺度数据集上的性能。多类分类处理提出混合基数集成结合分层分类使模型能处理任意数量的类别。回归的分位数预测预测 999 个分位数使用 pinball 损失训练推理时平均分位数用于点估计并可构建完整概率分布。3. 预训练与推理优化三阶段预训练逐步扩大合成数据集规模使用 Muon 优化器、谨慎权重衰减、梯度裁剪和余弦学习率调度。预训练成本约 24.5 个 H100 GPU 天低于 TabICL。推理优化实现磁盘卸载内存映射文件可在 50GB GPU 内存下处理百万级样本表格通过选择性计算 Q/K/V 投影减少冗余计算。4. 合成数据先验设计了一个全新的先验基于结构因果模型框架融合了 TabICL 和 TabPFNv2 的创新并增加了许多新机制如相关标量采样、随机图采样、随机节点函数、多种随机函数和矩阵类型等。该先验是性能关键使用旧先验TabICL预训练会导致性能显著下降。5. 实验结果基准测试在 TabArena 和 TALENT 基准上未经调优的 TabICLv2 超越了 RealTabPFN-2.5调优集成微调。性能优势在二分类、多分类和回归任务上均表现优异尤其在多分类10 类和大数据集上优势明显。推理速度显著快于 TabPFN-2.5在 H100 上 50K 样本时快 10.6 倍CPU 上 10K 样本时快 11.8 倍。可原生处理百万级数据集在 600K 样本的大规模数据集上仍表现强劲。消融研究验证了先验、早期目标嵌入、Muon 优化器和 QASSMax 等组件的显著贡献。6. 局限性与未来工作不原生利用列名或文本特征的语义信息。百万级样本数据集仍具挑战性。未评估分布回归能力缺失值处理仍为均值填充。超参数调优或微调可进一步提升性能但未探索。TabICLv2 通过架构创新QASSMax、重复特征分组、目标感知嵌入、优化的预训练协议Muon 优化器、三阶段课程和新颖的合成数据先验实现了表格基础模型的 SOTA 性能同时保持了高效推理和良好的可扩展性并承诺完全开源以推动该领域的研究。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要表格基础模型如 TabPFNv2 和 TabICL最近在预测基准测试中取代了梯度提升树登顶榜首展示了上下文学习在表格数据上的价值。我们推出 TabICLv2这是一个新的回归和分类最先进基础模型建立在三大支柱之上(1) 一个新颖的合成数据生成引擎专为高预训练多样性而设计(2) 各种架构创新包括一种新的可扩展 softmax 注意力机制可在不进行 prohibitive 长序列预训练的情况下改善对更大数据集的泛化能力(3) 优化的预训练协议特别是用 Muon 优化器替换 AdamW。在 TabArena 和 TALENT 基准测试上未经任何调优的 TabICLv2 超越了当前最先进模型 RealTabPFN-2.5经过超参数调优、集成并在真实数据上微调的性能。仅使用适度的预训练计算量TabICLv2 就能有效泛化到百万级数据集GPU 内存占用低于 50GB同时明显快于 RealTabPFN-2.5。我们提供了广泛的消融研究来量化这些贡献并承诺开放研究首先在 GitHub - soda-inria/tabicl: TabICLv2: An open tabular foundation model · GitHub 发布推理代码和模型权重合成数据引擎和预训练代码随后发布。1. 引言表格数据无论是存储在电子表格还是数据库中在从医疗保健到信用卡欺诈检测等应用中无处不在Borisov et al., 2022; Jesus et al., 2022; Grinsztajn et al., 2025。虽然表格数据上的监督学习长期由梯度提升决策树主导Grinsztajn et al., 2022但预训练和从头训练的深度学习模型最近已经能够在多达 10 万样本的表格上匹配甚至超越其准确率Erickson et al., 2025; Ye et al., 2024。特别是从 TabPFNHollmann et al., 2022开始表格基础模型TFM因其能够在基于 Transformer 架构的单次前向传播中执行训练和推理而受到广泛关注。更好的 TFM 的开发也有益于下游适配如因果推断、生成建模、联合预测分布和基于模拟的推断Ma et al., 2025b; Robertson et al., 2025; Balazadeh et al., 2025; Hollmann et al., 2025; Hassan et al., 2025; Vetter et al., 2025。为了促进这项研究迫切需要完全开源的 TFM以与闭源模型竞争从而普及顶级性能的获取并揭开顶级 TFM 背后配方之谜。贡献我们推出 TabICLv2一个最先进的表格基础模型如图 1 所示。我们的贡献包括架构创新第 3 节、预训练改进第 4 节、一种新颖的合成数据……2. 相关工作2.1 表格基础模型合成先验数据集。合成先验是 PFN 风格 TFM 的核心。TabPFN 使用结构因果模型SCM。TabICL 和 TabForestPFNBreejen et al., 2024通过混合基于树的先验来注入树归纳偏置从而扩展了这些。Mitra 研究了先验设计原则并提出了混合先验SCM 树集成以更好地控制决策边界。TabPFNv2 用更复杂的 DAG 构造和计算映射丰富了先验。LimiX 引入了具有可控难度的分层 SCM。Drift-Resilient TabPFNHelli et al., 2024通过一个两级生成先验来处理时间分布偏移该先验随时间调制 SCM 参数。然而TabDPTMa et al., 2025a表明在真实数据集上进行大规模预训练可以具有竞争力而 Real-TabPFNGarg et al., 2025表明在真实数据集上继续预训练可以改进 TabPFNv2。微调、检索和蒸馏。除了预训练之外TFM 的适配策略包括(a) 微调以将学习到的先验转向目标分布Feuer et al., 2024; Liu Ye, 2025; Garg et al., 2025; Kolberg et al., 2025; Rubachev et al., 2025(b) 基于检索的上下文选择以增强计算受限的可扩展性Thomas et al., 2024; Xu et al., 2024; Zhang et al., 2025b; Sergazinov Yin, 2025以及 (c) 将 TFM 蒸馏为紧凑的 MLP 或树Bonet et al., 2024; Mueller et al., 2024; Grinsztajn et al., 2025。基于 LLM 的表格模型。与表格原生 TFM 并行大型语言模型LLM已通过表格序列化和继续预训练被适配到表格数据Hegselmann et al., 2023; Gardner et al., 2024; Dong et al., 2025这些方法很有前景但当有足够的训练数据时其表现不如 TFM。2.2 注意力在长上下文泛化中的困境注意力衰减。注意力是 PFN 风格 TFM 的核心。但基于 softmax 的标准注意力存在注意力衰减问题Veličković et al., 2024; Nakanishi, 2025随着上下文长度 n 增长softmax 分母增大导致注意力分布变得平坦无法对相关 token 保持锐利聚焦。这限制了长度泛化能力因为在较短序列上训练的模型在应用于较长序列时无法保持判别性注意力模式。3. 架构回归的分位数预测。现有的 TFM 对回归采用不同的策略TabPFNv2 和 TabPFN-2.5 通过将目标空间离散化为箱并应用交叉熵损失来建模完整的预测分布而 Mitra 和 TabDPT 使用 MSE 损失预测点估计。此外与除 LimiX 之外的大多数 TFM 一样我们为分类和回归训练单独的模型。TabICLv2 改为预测概率水平 α∈{0.001,0.002,…,0.999} 处的 999 个分位数使用对所有分位数求和的 pinball 损失进行训练。在使用 RMSE 评估的初步实验中我们发现分位数回归优于 MSE 和 TabPFNv2 的基于箱的方法。在推理时对于点估计我们简单地平均预测的分位数这被证明既快速又有效。对于概率预测我们通过排序默认或等渗回归Barlow Brunk, 1972; Busing, 2022强制执行单调性从分位数构建完整分布使用参数指数模型外推尾部并推导出闭式 PDF、CDF 和矩。详见附录 I。4. 预训练和推理4.1 预训练设置与 TabICL具有开放预训练的参考 TFM相比我们显著改进了预训练设置。三个预训练阶段。我们保留了 TabICL 的三阶段结构逐步扩大预训练数据集的大小所有阶段最多 100 个特征。然而遵循 TabPFNv2我们将批量大小减少到 64允许用更少的数据集约 35M进行更多步骤而 TabICL约 83M和 TabPFNv2约 130M。三个阶段是阶段 1在 1,024 个样本的数据集上训练 500K 步30-90% 用于训练最大学习率 8e-4。阶段 2在 400-10,240 个样本对数均匀的数据集上训练 40K 步80% 用于训练最大学习率 1e-4。阶段 3在 400-60K 个样本对数均匀的数据集上训练 10K 步80% 用于训练最大学习率 2e-5。在附录 B.1 中我们展示了阶段 2 和 3 带来了渐进的性能提升尤其是在大型数据集上。预训练成本。在具有 80GB 内存的 H100 GPU 上阶段 1 大约需要 20 个 GPU 天阶段 2 大约 2.5 个 GPU 天阶段 3 大约 2 个 GPU 天每个模型总计 24.5 个 GPU 天。鉴于一个 H100 小时大约相当于 2 个 A100 小时我们的预训练成本低于 TabICL60 个 A100 天。4.2 推理优化我们实现了磁盘卸载附录 H.2将要求在 450 秒内处理具有 1M 样本和 500 个特征的表格所需的内存降至 24 GB CPU 和 50 GB GPU 以下图 H.2。结合用于长上下文泛化的 QASSMaxTabICLv2 可以原生处理百万级表格无需检索和蒸馏。此外我们通过选择性计算 Q/K/V 投影附录 H.1减少了冗余计算。5. 合成数据先验我们的预训练数据完全是合成的遵循 TabPFNHollmann et al., 2022开创的方法。数据生成机制被称为先验因为它隐式地定义了数据集上的贝叶斯先验。对于 TabICLv2我们设计了一个新的先验保留了 Hollmann et al. (2022) 中使用的结构因果模型框架结合了 TabICL 和 TabPFNv2 先验带来的创新并增加了许多新颖的设计选项和采样机制见附录 E.1。与架构和预训练选择不同新先验的开发大多没有实验反馈因为细粒度消融不切实际且容易过拟合验证数据集。相反先验开发由一般设计原则指导Wilson Izmailov, 2020最大化数据集多样性例如变量依赖关系和分类基数同时编码有用的归纳偏置并保持计算效率。这个新先验是最终性能的关键使用 TabICL 先验预训练 TabICLv2 会产生显著更低的性能图 10灰色。使用 TabPFNv2 先验的消融是不可能的因为它不是开源的。我们在下面提供高层次先验描述细节推迟到附录 E 和 F。6. 实验基准测试。我们使用 TabArenaErickson et al., 2025和 TALENTYe et al., 2024基准测试。TabICLv2 像 TabICL 一样使用随机列/类别混洗和不同的预处理器来集成预测。TabArena 包含 51 个数据集38 个分类类别数 ≤1013 个回归通过重复交叉验证进行评估二元分类使用 ROC AUC多类分类使用对数损失回归使用 RMSE。我们为 TabICLv2 使用 8 个估计器以在 TabArena 中匹配 RealTabPFN-2.5。TALENT 包含 300 个数据集120 个二元分类、80 个多类分类、100 个回归训练/验证/测试分割为 64%/16%/20%。超参数在验证集上使用分类准确率和回归 RMSE 进行选择。我们在 TALENT 中为 TabICLv2 和 TabPFN-2.5/RealTabPFN-2.5 都使用 32 个估计器。我们主要报告可改进性它衡量与每个数据集上最佳方法的平均相对误差差距允许最佳方法因数据集而异。与基于排名的指标相比可改进性反映了性能差异的幅度。我们在附录 J 和 K 中提供了其他指标。此外遵循 TabArena 和 TALENT我们使用 TabICLv1.1 检查点作为 TabICLQu et al., 2025这是在早期版本先验上后训练的 TabICL。TabICLv2 在两个基准测试上均达到最先进水平。如图 1 和图 5 所示TabICLv2 在可改进性与运行时间的帕累托前沿上占据主导地位。未经任何调优TabICLv2 就超越了 RealTabPFN-2.5调优 集成这是当前并非完全开源的最先进模型。TabICLv2 也大幅超越了经过大量调优的传统方法如 CatBoost 和 XGBoost尽管所需的训练时间少了几个数量级。TabICLv2 始终快于 TabPFN-2.5。如图 6 所示对于 100 个特征TabICLv2 在所有硬件上都比 TabPFN-2.5 快且加速比随规模增大而增加在 H100 GPU 上50K 样本时加速 10.6×。在 CPU 上效率差距更为明显仅 10K 样本时就达到 11.8×。TabICLv2 在多类分类上表现出色。TabICLv2 结合 TabPFNv2 的纠错输出码ECOC包装器和我们的原生混合基数集成在 TALENT 中类别数 10 的数据集上大幅超越所有基线图 7。ECOC 包装器略好但比我们的原生处理慢 3×。TabICLv2 可扩展到大型数据集。如图 8 所示TabICLv2 在从 1000 到 100000 的所有数据集大小上都保持最高排名在较大数据集20K上优于 RealTabPFN-2.5。在来自 TALENT 扩展的更大数据集600K上TabICLv2 仍然表现强劲图 9。这些结果表明TabICLv2 进一步扩展了 TFM 原生处理大规模数据的前沿。7. 消融研究我们进行了一项消融研究以评估架构、先验和预训练选择的影响图 10。参见附录 C 了解更多消融结果。参考 TabICLv2 检查点黑色虚线与其消融黑色实线之间的性能差距由预训练长度解释消融训练了 280K 步而官方检查点预训练了更多步阶段 1 为 500K 步加上阶段 2 和 3并且在 TFcol 和 TFrow 中使用 8 个而不是 4 个注意力头。有趣的是TabICLv2 在约 200K 步后在对数损失上匹配 RealTabPFN-2.5在归一化准确率上不到 100K 步就匹配了。首先我们观察到架构和先验之间存在强烈的交互作用。使用 TabICL 先验预训练 TabICLv2 失败灰线性能仍然低于 TabICL并且验证损失在预训练的后半段恶化。这表明 TabICLv2 架构需要更高的先验多样性才能泛化也许类似于 Ma et al. (2025a) 观察到的当合成数据生成器较弱时缩放定律可能会失效。此外使用 TabICLv2 先验预训练 TabICL 架构橙色仅能匹配 TabICL表明 TabICL 架构利用增加的先验多样性的能力有限。在包括归一化准确率、Elo 和对数损失在内的指标图 C.1上消融的顺序是一致的。先验产生的影响最大。三个组件提供了相当显著的增益约 100 Elo64% 胜率早期目标包含、用 Muon 代替 AdamW 以及 QASSMax。重复特征分组和先验过滤产生较小的增益。8. 局限性TabICLv2 与相关模型有共同的局限性它不能原生利用列名或文本特征中的语义信息这些信息已被证明是有价值的Spinaci et al., 2025但其对大量特征的可扩展性表明当与文本嵌入模型结合时它应该保持相当快。此外尽管可扩展性有所提高但具有数百万样本的数据集仍然具有挑战性。许多扩展如多输出回归或处理分布偏移Helli et al., 2024也留待未来工作。由于缺乏成熟的基准测试TabICLv2 的分布回归能力未在玩具数据集之外进行评估附录 I.9。添加缺失指示符Le Morvan Varoquaux, 2025或在预训练期间引入缺失性可能会改善对缺失值的处理目前缺失值通过均值插补但仍未探索。最后超参数调优或微调Rubachev et al., 2025可以以增加运行时间为代价进一步提高性能但本文未探索。9. 结论TabICLv2 代表了表格基础模型TFM的重大进步因为它实现了最先进的性能并重新定义了 TFM 的原生可扩展性。我们承诺完全开源一切以普及最先进 TFM 的获取。凭借适度的预训练和推理成本TabICLv2 为未来的适配提供了极好的基础。此外我们优先考虑开箱即用的性能和原则性创新而不是在真实数据上微调Garg et al., 2025或使用更深Grinsztajn et al., 2025或更宽Ma et al., 2025a; Zhang et al., 2025a的架构进行扩展。我们希望 TabICLv2 能激发持续创新朝着更小、更快、更好的模型发展。