TabFM gegen XGBoost: 5 Fakten, die nicht in der Veröffentlichung stehen
Google/DeepMind
Dieser Artikel analysiert das neue TabFM-Modell von Google Research, das Tabellenvorhersagen ohne Training durchführt. Der Autor prüft die Behauptungen, deckt Einschränkungen auf und teilt unabhängige Benchmarks. Die wichtigste Erkenntnis: Zero-Shot-TabFM kann getuntes Gradient Boosting übertreffen, aber versteckte Einschränkungen wie Kontextgrößen-Limits und synthetische Trainingsdaten müssen berücksichtigt werden.
Der Artikel von Sergey Proshchaev, einem Tech Lead aus dem Bereich FinTech & E-Commerce, behandelt TabFM, ein Modell, das am 30. Juni 2026 von Google Research veröffentlicht wurde. TabFM liest eine Tabelle als einen einzigen Kontext, verwendet eingefrorene Gewichte und In-Context-Learning und macht ein Training mit Ihren Daten überflüssig. Es ist der Nachfolger von TimesFM für Zeitreihen und folgt der Linie von TabPFN (2022). Das Modell wurde mit Hunderten Millionen synthetischer Datensätze vortrainiert, die durch strukturelle kausale Modelle erzeugt wurden, nicht mit echten Unternehmensdaten. Der Artikel hebt hervor, dass der scikit-learn-Wrapper Standardgrenzen von 500 Merkmalen und 100 Kontextzeilen hat, sodass das Modell bei größeren Tabellen eine Stichprobe zieht. Unabhängige Benchmarks von Yash Raj Pandey zeigen, dass TabFM auf kleinen und mittleren Tabellen besser abschneidet als ein abgestimmtes XGBoost, aber einige Vorteile verschwanden, wenn mehrere Seeds berücksichtigt wurden. Der Artikel weist auf Speicherprobleme hin: Die angegebenen 22,75 GB Videospeicher waren größtenteils ein Artefakt des XLA-Allokators, wobei der tatsächliche Verbrauch bei etwa 16,95 GB lag; die Aktivierung von bf16 und Aktivierungs-Chunking in PyTorch reduzierte den Speicher auf 3-7 GB. Der Autor schlägt ein ordnungsgemäßes Evaluierungsprotokoll mit mehreren Seeds und gleichen Budgets für die Hyperparameter-Abstimmung vor. Der Artikel kommt zu dem Schluss, dass TabFM zwar vielversprechend ist, sein Verhalten bei unbereinigten Unternehmensdaten und Verteilungsdrift jedoch nicht charakterisiert ist, weshalb eine Validierung mit Ihren eigenen Daten unerlässlich ist.
Quelle: Habr — хаб ИИ —
Original
