MallitTutkimus 🇷🇺 12.08.2026 22:02

TabFM vs. XGBoost: 5 faktaa, joita ei ole julkaisussa

Google/DeepMindGoogle/DeepMind
Tämä artikkeli analysoi Google Researchin uutta TabFM-mallia, joka tekee taulukkoennusteita ilman koulutusta. Kirjoittaja tarkistaa väitteet, paljastaa rajoituksia ja jakaa riippumattomia vertailuarvoja. Keskeinen johtopäätös: zero-shot TabFM voi päihittää viritetyn gradienttitehostuksen, mutta piilossa olevat rajoitteet, kuten kontekstin koon rajat ja synteettinen harjoitusdata, on otettava huomioon.
Sergey Proshchaevin, FinTech & E-commerce -sektorin tech lead -kirjoittama artikkeli käsittelee TabFM-mallia, jonka Google Research julkaisi 30. kesäkuuta 2026. TabFM lukee taulukon yhtenä kontekstina käyttäen jäädytettyjä painoja ja kontekstissa oppimista, jolloin harjoittamista omalla datalla ei tarvita. Se on aikasarjojen TimesFM-mallin seuraaja ja jatkaa TabPFN:n (2022) linjaa. Malli esiharjoitettiin sadoilla miljoonilla synteettisillä datasarjoilla, jotka generoitiin rakenteellisilla kausaalimalleilla, ei oikealla yritysdatan avulla. Artikkelissa korostetaan, että scikit-learn-kääreellä on oletusarvoiset rajat: enintään 500 ominaisuutta ja 100 kontekstiriviä, joten malli ottaa otoksen, jos taulukko on suurempi. Yash Raj Pandeyn riippumattomat vertailut osoittavat TabFM:n päihittävän viritetyn XGBoostin pienillä ja keskikokoisilla taulukoilla, mutta osa voitoista katosi, kun huomioitiin useita siemeniä. Artikkelissa huomautetaan myös muistiongelmista: väitetty 22,75 gigatavun näytönmuisti oli enimmäkseen XLA-allokaattorin artefakti, ja todellinen käyttö oli noin 16,95 gigatavua; bf16:n ja aktivaatioiden pilkkomisen käyttöönotto PyTorchissa vähensi muistin käytön 3–7 gigatavuun. Kirjoittaja ehdottaa asianmukaista arviointiprotokollaa, jossa käytetään useita siemeniä ja yhtäläisiä budjetteja hyperparametrien viritykseen. Artikkeli päättyy toteamukseen, että vaikka TabFM vaikuttaa lupaavalta, sen käyttäytyminen epäsiistillä yritystaulukoilla ja jakauman muutoksissa on kuvailematonta, joten validointi omalla datalla on välttämätöntä.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset