Google Apresenta TabFM: Um Modelo Fundacional para Dados Tabulares com Aprendizado Zero-Shot
Google/DeepMind
O Google Research revelou o TabFM, um modelo fundacional para dados tabulares que utiliza aprendizado zero-shot em contexto para realizar classificação e regressão sem treinamento manual ou engenharia de atributos. O modelo é treinado inteiramente em centenas de milhões de conjuntos de dados sintéticos gerados por meio de modelos causais estruturais e supera algoritmos tradicionais como XGBoost no benchmark TabArena. O TabFM será integrado ao Google BigQuery, permitindo que os usuários executem previsões com um simples comando SQL.
A Google Research apresentou o TabFM, um novo modelo fundamental especificamente projetado para classificação e regressão de dados tabulares. O modelo utiliza uma abordagem de aprendizado em contexto (in-context learning, ICL), tratando todo o conjunto de dados como um prompt unificado para interpretar relações entre colunas e linhas no momento da inferência, eliminando a necessidade de ajuste de hiperparâmetros e engenharia de atributos. O TabFM sintetiza pontos fortes de arquiteturas como TabPFN e TabICL em um design híbrido inovador para lidar com a natureza bidimensional e sem ordem das tabelas. Treinado inteiramente em centenas de milhões de conjuntos de dados sintéticos gerados usando modelos causais estruturais (structural causal models, SCMs), o TabFM generaliza bem para dados reais não vistos. Avaliado no benchmark TabArena em 38 conjuntos de dados de classificação e 13 de regressão, ele supera consistentemente algoritmos supervisionados com ajuste intensivo, como XGBoost. O TabFM será integrado ao Google BigQuery, permitindo que os usuários realizem regressão e classificação avançadas com um simples comando SQL AI.PREDICT.
Fonte: Google Research —
original
