模型研究 🇷🇺 12.08.2026 22:02

TabFM 对比 XGBoost:发布稿中未提及的 5 个事实

Google/DeepMindGoogle/DeepMind
本文分析了 Google Research 发布的新模型 TabFM,该模型无需训练即可进行表格预测。作者核查了相关声明,揭示了局限性,并分享了独立基准测试结果。关键结论是:零样本的 TabFM 可以超越调优后的梯度提升模型,但需要考虑上下文大小限制和合成训练数据等隐藏注意事项。
Sergey Proshchaev是来自金融科技与电商领域的Tech Lead,其文章讨论了Google Research于2026年6月30日发布的模型TabFM。TabFM将表格视为单个上下文,利用冻结权重和上下文学习,无需对您的数据进行训练。它是时间序列模型TimesFM的继任者,沿袭了TabPFN(2022)的路线。该模型在由结构因果模型生成的数亿个合成数据集上进行了预训练,并未使用真实的企业数据。文章指出,scikit-learn包装器默认限制为500个特征和100个上下文行,因此如果表格更大,模型会进行采样。独立基准测试(由Yash Raj Pandey进行)显示,在中小型表格上,TabFM优于调优后的XGBoost,但考虑多个随机种子时,部分优势消失。文章还提到内存问题:宣称的22.75 GB视频内存大多是XLA分配器的伪影,实际使用量约为16.95 GB;在PyTorch中启用bf16和激活分块后,内存降至3-7 GB。作者建议采用包含多个随机种子和同等超参数调优预算的规范评估协议。文章总结道,尽管TabFM显示出潜力,但其在脏乱的企业表格和分布漂移上的表现尚未明确,因此在您自己的数据上进行验证至关重要。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻