Google presenta TabFM: un modelo fundacional para datos tabulares con aprendizaje sin ejemplos previos
Google/DeepMind
Google Research ha presentado TabFM, un modelo fundacional para datos tabulares que utiliza aprendizaje en contexto sin ejemplos previos para realizar clasificación y regresión sin necesidad de entrenamiento manual ni ingeniería de características. El modelo se entrena completamente con cientos de millones de conjuntos de datos sintéticos generados mediante modelos causales estructurales y supera a algoritmos tradicionales como XGBoost en el punto de referencia TabArena. TabFM se integrará en Google BigQuery, lo que permitirá a los usuarios ejecutar predicciones con un simple comando SQL.
Google Research ha presentado TabFM, un nuevo modelo fundacional diseñado específicamente para clasificación y regresión de datos tabulares. El modelo utiliza un enfoque de aprendizaje en contexto (ICL, por sus siglas en inglés), tratando todo el conjunto de datos como un único prompt para interpretar relaciones entre columnas y filas durante la inferencia, eliminando la necesidad de ajuste de hiperparámetros e ingeniería de características. TabFM sintetiza fortalezas de arquitecturas como TabPFN y TabICL en un diseño híbrido novedoso para manejar la naturaleza bidimensional y sin orden de las tablas. Entrenado completamente en cientos de millones de conjuntos de datos sintéticos generados mediante modelos causales estructurales (SCM, por sus siglas en inglés), TabFM generaliza bien a datos reales no vistos. Evaluado en el benchmark TabArena en 38 conjuntos de datos de clasificación y 13 de regresión, supera consistentemente a algoritmos supervisados fuertemente ajustados como XGBoost. TabFM se integrará en Google BigQuery, permitiendo a los usuarios realizar regresión y clasificación avanzadas con un simple comando SQL AI.PREDICT.
Fuente: Google Research —
original
