一、研究背景与问题1. 背景表格基础模型Tabular Foundation Models近年来兴起代表工作包括TabPFN系列和TabICL系列。这些模型架构上与 Transformer/LLM 相似但规模和 serving 模式差异很大模型本身较小权重量化收益有限主要计算瓶颈在上下文学习ICL阶段的注意力计算注意力成本随训练行数 N 呈二次增长O(N2MN)而权重矩阵乘法只线性增长 O(NM)。2. 核心问题论文要回答能否对表格基础模型的注意力计算做 FP8 量化量化后准确率是否会明显下降能否在真实硬件上获得实际加速与 LLM 中常见的权重量化、KV 缓存量化相比重点应该放在哪里二、核心方法1. 量化对象不是量化权重或 KV 缓存而是量化融合注意力中的两个矩阵乘法3. 关键设计训练-测试协调表格基础模型的 ICL 阶段有两个独立注意力调用train–train attention训练查询关注训练键test–train attention测试查询关注同一批训练键。论文发现必须同时对两个调用做量化否则准确率大幅下降更关键的是两个调用必须看到相同版本的 K,V测试查询的缩放因子应复用训练查询的缩放因子而不是自己动态计算这样既保持准确率又让预测具有批次不变性。4. Kernel 实现使用Triton kernel设计上接近 FA2量化方式接近 FA3。使用显式 FP8 矩阵乘法指令。在 RTX Pro 6000 Blackwell 上当 N8192 时启用 FP8因为量化开销在此之后被摊销。三、关键发现1. 量化两个注意力调用几乎无损在 TabArena 上只量化 train–trainΔElo 约 −31.8明显变差只量化 test–trainΔElo 约 −20.3明显变差两者都量化ΔElo 约 −1.0 到 −1.3几乎可忽略共享训练查询缩放结果与每次调用单独缩放相当但预测批次不变。2. 协调性比量化本身更重要论文用高斯噪声实验替代量化发现只要两个注意力调用接收相同版本的 K,V即使加噪模型也能承受如果两个调用看到不同的 K,V性能急剧下降。这说明这是模型架构的一种更普遍特性train 和 test 注意力之间的协调至关重要这是 LLM 中不存在的概念。3. 实际加速显著在 RTX Pro 6000 上Kernel 加速最高1.72×端到端加速最高1.67×在 512k 训练行时端到端从 334.5s 降到 200.4s16 位自制 kernel 与 FA2 基线接近说明加速确实来自 FP8 张量核心。4. 准确率影响在种子噪声内TabArena51 个数据集中 18 个触发 FP8ΔElo 约 −0.1 到 −0.5符号检验多数不显著BeyondArena142 个数据集中 56 个触发 FP8ΔElo 在 −2.0 到 0.6 之间统计上不显著在 BeyondArena 上FP8 模型平均在相对误差上还略占优但作者归因于噪声FP8 误差小于 TabPFN 预处理种子间的差异。5. 泛化到 TabICLv2在 TabICLv2 上同样几乎无损512k 训练行端到端加速1.56×说明 FP8 注意力不依赖特定架构、先验或优化选择。6. 泛化到不同头维度和硬件头维度 128加速最高1.82×比 64 更大NVIDIA L4加速最高1.89×部分归因于 torch SDPA 在该硬件上未完全优化头维度越大矩阵乘法占比越高FP8 收益越明显。四、实验设置与基准项目内容主力模型TabPFN-v3验证模型TabICLv2基准TabArena51 数据集、BeyondArena142 数据集56 个超 8192 行硬件NVIDIA RTX Pro 6000 Blackwell、NVIDIA L4基线torch SDPAFA2种子3 个 TabPFN 预处理种子门控N8192 才启用 FP8统计方法单侧符号检验零假设为模型未变差五、局限性与未来方向1. 硬件局限当前 kernel 是 FA2 设计不使用 TMA在 B200/H100 上需要 TMA 才能达到 16 位性能在 B200 上即使 16 位计算softmax 也可能成为瓶颈FP8 矩阵乘法未必带来有意义加速。2. 方法局限目前只针对 ICL 注意力对极小数据集无收益需门控TabICLv2 上其他操作占延迟比例更大加速低于 TabPFN-v3。3. 未来方向将 FP8 注意力作为训练后即插即用优化进一步优化 kernel 以适配 Hopper/Blackwell 的 TMA探索更多表格基础模型和硬件平台研究 train–test 协调机制的理论解释。这篇论文首次系统研究了表格基础模型中的 FP8 注意力量化发现必须同时量化 train–train 和 test–train 注意力并让两者共享相同的 K,V 版本才能在几乎不损失准确率的前提下在 Blackwell GPU 上实现最高1.7× 端到端加速这为表格基础模型的训练后推理优化开辟了新方向也揭示了与 LLM 量化截然不同的关键设计原则。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要随着表格基础模型近期的兴起与采用优化其推理性能正成为效率研究的一个新兴领域。虽然这些模型在架构上与基于 Transformer 的大语言模型LLM相似但其规模和 serving 模式存在显著差异。我们表明重点应放在注意力计算上而非 LLM 中更流行的权重或 KV 缓存量化。我们开发了一种将查询queries、键keys和值values量化为 FP8 的策略并使用显式的 FP8 矩阵乘法指令来加速注意力计算。我们发现关键在于将测试行中的量化误差与训练行中的量化误差对齐否则准确率会急剧下降。我们的 Triton kernel 相比常规 16 位 kernel 实现了最高 1.7 倍的加速并且我们表明在 TabPFN-v3 和 TabICLv2 上在 TabArena 和 BeyondArena 上均无相关准确率损失。图 1FP8 注意力 kernel 与端到端加速左。当训练行超过 8192 时kernel 被启用。准确率影响右在 TabArena [Erickson et al., 2026] 和 BeyondArena [Purucker et al., 2026] 上处于种子噪声范围内并且我们观察到在 BeyondArena 上整个评估套件包括数据准备和评分有大幅的挂钟时间加速。1 引言基于 Transformer 的模型 [Vaswani et al., 2017] 现已被广泛采用于大语言模型LLM近来也被用于表格基础模型。其广泛采用使得降低推理成本和延迟变得必要。对于 LLM量化 [Frantar et al., 2023, Park et al., 2024, Kurtic et al., 2025] 一直是降低成本与延迟最成功的方法之一。对于表格基础模型如 TabPFN [Hollmann et al., 2025, Grinsztajn et al., 2026] 或 TabICL [Qu et al., 2025, 2026] 模型家族模型本身仍然相当小因此权重量化 [Luo et al., 2026] 带来的收益有限。我们转而探索对融合注意力中的矩阵乘法进行量化。这对表格基础模型尤其有帮助因为其成本随训练数据集行数呈二次增长而行数可能达到数十万甚至数百万。然而预测性能会受到怎样的影响尚不清楚。现代硬件加速器如 NVIDIA 的 Hopper 和 Blackwell GPU、AWS 的 Trainium 3 或 AMD Instinct MI325X提供了 FP8 矩阵乘法指令其吞吐量是 16 位对应指令的两倍。虽然在独立的大矩阵乘法中可以实现加速但在融合注意力 kernel 中实现加速并非易事因为其他操作如指数运算可能成为瓶颈 [Zadouri et al., 2026]。因此FP8 矩阵乘法能否带来加速取决于架构和硬件规格。据我们所知这是首个在表格基础模型背景下研究 FP8 注意力的工作。我们使用 TabPFN-v3 [Grinsztajn et al., 2026] 作为主力模型我们的结果支持在训练后以即插即用方式使用具有 FP8 注意力的模型。首先我们表明对 Transformer 的上下文学习ICL层中的查询、键和值进行逐头 absmax 缩放量化可以在不造成相关准确率下降的情况下完成。值得注意的是只有当训练-训练注意力和测试-训练注意力都被量化时这几乎是无损的。其次我们表明在 NVIDIA RTX Pro 6000 上通过 FP8 可以实现高达 1.7 倍的 kernel 加速。虽然我们的消融实验围绕一个模型展开但我们也在 TabICLv2 [Qu et al., 2026] 上进行了评估并获得了相似的准确率和速度结果。2 方法图 2单个头的量化方法示意图。我们使用逐头缩放的 absmax 量化对 Q,K,V 进行量化然后在 kernel 中将 Q 和 K 的缩放因子与 softmax 缩放因子一起应用而 VV 的缩放因子在 epilogue 中应用。PP 矩阵从不物化到全局内存中并在 kernel 内部使用固定缩放因子进行量化。对于测试-训练注意力K 和 V 来自训练行因此保持其缩放因子。然而对测试查询计算动态缩放因子会耦合测试行的计算。虽然这不会可测量地影响准确率但它使预测依赖于确切的测试批次。因此我们提出使用在训练查询上计算的缩放因子并将其复用于测试查询。我们的实验表明这同样有效并且使测试预测具有批次不变性。我们 kernel 的基线是通过 torch scaled dot product attention (SDPA) 调用的 FA2 [Dao, 2023]。注意 FA3 或 FA4 不适用于 RTX Pro 6000。我们的 kernel 是一个 Triton kernel非常紧密地遵循 FA2 的总体设计量化方式类似于 FA3 [Shah et al., 2024]见图 2。虽然存在针对其他架构的其他低精度注意力 kernel [Zhang et al., 2025b,a, Shah et al., 2024]但我们注意到先前针对 Hopper 和 Ampere 架构的低精度 kernel 必须绕过隐式的低精度累加器 [Zhang et al., 2025a, Section 3.4]这会损失性能但对于我们目标所在的 Blackwell 芯片则不需要。图 1 比较了 kernel 速度与 FP16 基线。量化开销在 N8192 时被摊销因此我们的最终方案以此作为门控条件。3 实验对于主要实验我们使用 TabPFN-v3 [Grinsztajn et al., 2026]并将确认我们发现的 TabICLv2 [Qu et al., 2026] 结果推迟到附录。虽然我们的最终方案以 N8192 为门控条件但第 3.1 节首先研究不同的量化策略不加门控以独立于延迟方面研究量化的准确率影响。我们所有实验均在 RTX Pro 6000 Blackwell edition 上运行。作为参考TabArena 排行榜上的模型通常相差超过 10 Elo 分。3.1 对 TabArena 的质量影响我们首先在 TabArena [Erickson et al., 2026] 上测试量化方案和 kernel 的质量影响运行包含 51 个数据集的完整套件。我们实验了将 FP8 仅应用于训练 ↔ 训练、仅应用于测试 ↔ 训练或两者都应用其中我们还区分了是否将训练查询的缩放因子也用于测试查询。除了效应量之外我们还计算了模型未变差的零假设的 pp 值。遵循 Kübler et al. [2026]我们假设训练后量化只会使模型变差并使用单侧符号检验。我们运行了 TabPFN-v3 预处理的三个种子。汇总结果见表 1完整结果见表 2。我们发现量化两个注意力调用可以最小化退化且下降在实践中几乎可以忽略。话虽如此我们严格的统计处理表明当 kernel 不加门控应用时这一微小的 Elo 下降很可能是小的但可检测的回归。此外将训练行的查询缩放因子与测试行共享不会以相关方式改变结果但使预测具有批次不变性因此我们选择这种方法用于最终实验。表 1TabPFN-v3 上 TabArena 的 FP8 注意力消融无 N8192 门控。FP8 应用于Δ error (%)Δ Elo符号检验 p仅 train→train2.81 ± 0.73-31.8 ± 4.10.001-0.012仅 test→train2.38 ± 0.77-20.3 ± 2.40.001-0.005两者每次调用查询缩放0.01 ± 0.03-1.0 ± 0.40.024-0.131两者共享训练查询缩放0.02 ± 0.03-1.3 ± 0.30.024-0.080图 3当向 Q,K,V 添加高斯噪声时三个随机种子下 TabArena 的性能左和端到端运行时间缩放右。3.2 自注意力与交叉注意力之间需要协调在表 1 中我们发现对训练行和测试行应用相同的扰动至关重要。这可能反直觉因为如果我们只量化一个调用我们会应用更局部的扰动。这是该架构的一个显著特征为了研究它是否超越量化而成立我们进行了进一步实验。我们向 ICL 层的查询、键和值添加随机高斯噪声既仅在单个调用中也在两个调用中。当应用于两个调用时我们消融了独立噪声以及在注意力调用之间对 K 和 V 应用相同噪声协调见第 A.1 节。然后我们在 TabArena 上使用 3 个不同的随机种子进行评估。结果如图 3 所示表明这是模型更普遍的能力只要两个注意力调用接收到相同版本的 K 和 V就能承受注意力输入上的误差。3.3 延迟测量与最终配置实验我们研究了 kernel 延迟和由此产生的端到端延迟。量化在约 8,192 个训练行时被摊销。Kernel 加速达到 1.72 倍端到端加速达到 1.67 倍。完整结果见表 3图 1 可视化了相对加速。图 3 进一步展示了二次运行时间缩放以及使用 FP8 带来的巨大绝对收益。为了完整性我们还消融了我们 kernel 的 16 位变体以确保加速来自 FP8 计算而不仅仅是更好的 kernel 设计。结果见表 3表明我们的 16 位变体紧密跟随 FA2 基线。为了展示我们 kernel 的通用性在第 A.4 节中我们还研究了头维度 128 和 L4 GPU我们的 kernel 在这些情况下提供了更大的加速。对于最终运行我们仅在训练行超过 8,192 时激活 kernel门控并将从训练行计算的查询缩放因子与测试查询共享以使测试预测具有批次不变性。使用该配置我们再次运行 TabArena 以及 BeyondArena [Purucker et al., 2026]同样使用三个 TabPFN 预处理种子。BeyondArena 有 142 个数据集其中 56 个超过 8,192 门控。特别是它还有具有 1M 训练行的数据集。因此在该基准上虽然与基线基本持平但我们看到了大幅的挂钟时间加速见图 1 和表 2以及附录 A.2 中按数据集分辨的误差表明 FP8 误差小于预处理种子变异。表 2TabPFN-v3 上的准确率消融。我们在 TabPFN 中运行所有实验的三个种子而数据集不是随机的。n 是预测与基线完全不同的数据集数量门控组对低于 8192 训练行的数据集不作改动因此它们精确复现基线。它们不被纳入符号检验。win 是这些 n 中该组击败基线的比例因此 0.5 是零假设。这是符号检验所操作的量。Δerr 是 metric_error 的平均逐数据集相对变化正值表示更差。p 是单侧符号检验 p 值。4 结论与展望我们引入了面向表格基础模型的注意力量化并表明对于包含数十万训练行的数据集它可以将推理端到端加速最高 1.7 倍而在 TabArena 和 BeyondArena 上没有相关质量退化。虽然更快的预测时间提高了可用性但量化也以类似因子降低了成本。这为表格基础模型的训练后优化开辟了新方向我们发现训练行与测试行之间的协调是必需的这是 LLM 中不存在的概念。