ModelosInvestigación 🇷🇺 12.08.2026 22:02

TabFM frente a XGBoost: 5 datos que no aparecen en el lanzamiento

Google/DeepMindGoogle/DeepMind
Este artículo analiza el nuevo modelo TabFM de Google Research, que realiza predicciones sobre tablas sin necesidad de entrenamiento. El autor verifica las afirmaciones, revela limitaciones y comparte evaluaciones comparativas independientes. La conclusión clave: TabFM en modo de aprendizaje de cero disparos puede superar al aumento de gradiente afinado, pero hay que tener en cuenta advertencias ocultas como los límites de tamaño de contexto y los datos de entrenamiento sintéticos.
El artículo de Sergey Proshchaev, Tech Lead en FinTech & E-commerce, analiza TabFM, un modelo lanzado por Google Research el 30 de junio de 2026. TabFM lee una tabla como un contexto único, utilizando pesos congelados y aprendizaje en contexto, eliminando la necesidad de entrenar con tus datos. Es el sucesor de TimesFM para series temporales y sigue la línea de TabPFN (2022). El modelo fue preentrenado con cientos de millones de conjuntos de datos sintéticos generados mediante modelos causales estructurales, no con datos corporativos reales. El artículo destaca que el envoltorio de scikit-learn tiene límites predeterminados de 500 características y 100 filas de contexto, por lo que el modelo muestrea si la tabla es más grande. Los benchmarks independientes de Yash Raj Pandey muestran que TabFM supera a XGBoost ajustado en tablas pequeñas y medianas, pero algunas ventajas desaparecieron al considerar múltiples semillas. El artículo señala problemas de memoria: los supuestos 22,75 GB de memoria de video eran en su mayoría un artefacto del asignador XLA, con un uso real de aproximadamente 16,95 GB; habilitar bf16 y la fragmentación de activaciones en PyTorch redujo la memoria a 3-7 GB. El autor sugiere un protocolo de evaluación adecuado con múltiples semillas y presupuestos iguales para el ajuste de hiperparámetros. El artículo concluye que, aunque TabFM muestra potencial, su comportamiento con tablas corporativas sucias y deriva de distribución no está caracterizado, por lo que la validación con tus propios datos es esencial.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas