Koneet, jotka eivät osaa laskea, mutta arvaavat numeroita
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
Kielimallit (LLM:t) pystyvät ennustamaan numeerisia arvoja taulukkomuotoisesta datasta ilman hienosäätöä, ja ne yltävät joskus erikoistuneiden regressiotyökalujen tasolle tai jopa niiden ohi. Niillä on kuitenkin perustavanlaatuisia rajoitteita: ne käsittelevät numeroita tekstinä, niistä puuttuu tulkittavuus ja ne ovat kalliita. Uudet taulukoihin erikoistuneet mallit, kuten TabPFN, päihittävät LLM:t puhtailla numeerisilla taulukoilla.
Artikkelissa tarkastellaan, miksi suuret kielimallit (LLM) pystyvät ennustamaan numeerisia määriä, vaikka ne eivät todella ymmärrä numeroita. Toisin kuin perinteiset regressiotyökalut, kuten XGBoost, jotka käyttävät päätöspuumenetelmää, LLM:t käsittelevät numeroita merkkijonoina ja jakavat ne mielivaltaisesti tokeneihin. Vuonna 2024 tehdyissä kokeissa, jotka suorittivat tutkijat Arizonan yliopistosta ja Cluj-Napocan teknisestä yliopistosta, LLM-mallit, kuten GPT-4 ja Claude 3, saivat taulukon esimerkkejä ja niitä pyydettiin ennustamaan puuttuva arvo. Ilman minkäänlaista hienosäätöä ne suoriutuivat vertailukelpoisesti erikoistuneiden ohjelmien kanssa, ja Friedmanin #2-funktiossa Claude 3 jopa ylitti viisi tällaista työkalua. Mielenkiintoista on, että esimerkkien määrän lisääminen paransi tarkkuutta, eikä tätä voi selittää onnella. Tämä kontekstissa tapahtuva oppiminen on huomionarvoista, koska se ei vaadi lisäkoulutusta. LLM:t ovat kuitenkin epäluotettavia: niiden ennusteet vaihtelevat rivien järjestyksen ja numeroiden tarkkuuden mukaan, eikä niillä ole ylärajaa, joten ne voivat joskus antaa täysin virheellisiä vastauksia. Vaikka ne ovat kertaluokkaa kalliimpia ennustetta kohden kuin klassisia työkaluja, LLM:t loistavat silloin, kun dataa on vähän, se sisältää tekstiä tai kun sarakkeiden nimet ovat merkityksellisiä. Uudet erikoistuneet mallit, kuten TabPFN, joka julkaistiin Nature-lehdessä vuoden 2025 alussa, päihittävät LLM:t puhtaasti numeerisissa taulukoissa pienellä datamäärällä, ja ne pystyvät alle kolmessa sekunnissa voittamaan yhdistelmän klassisia menetelmiä, jotka toimivat neljä tuntia. Suosituksena on käyttää LLM:iä vain silloin, kun dataa on vähän tai kun siinä on merkityksellistä tekstiä, ja pitää niitä täydentävänä työkaluna eikä korvaavana klassisten menetelmien rinnalla.
Lähde: Habr — хаб ИИ —
Alkuperäinen
