Machines die niet kunnen tellen maar getallen raden
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
Taalmodellen (LLM's) kunnen numerieke waarden voorspellen uit tabelgegevens zonder enige fijnafstemming, en presteren soms net zo goed als of zelfs beter dan gespecialiseerde regressietools. Ze hebben echter fundamentele beperkingen: ze behandelen getallen als tekst, missen interpreteerbaarheid en zijn kostbaar. Nieuwe gespecialiseerde tabelgerichte modellen zoals TabPFN presteren beter dan LLM's op zuiver numerieke tabellen.
Het artikel onderzoekt waarom grote taalmodellen (LLM's) numerieke grootheden kunnen voorspellen, ondanks dat ze getallen niet echt begrijpen. In tegenstelling tot traditionele regressietools zoals XGBoost, die een beslissingsboomaanpak gebruiken, verwerken LLM's getallen als tekenreeksen en splitsen ze die willekeurig in tokens op. In een experiment uit 2024 van onderzoekers van de Universiteit van Arizona en de Technische Universiteit van Cluj-Napoca kregen LLM's zoals GPT-4 en Claude 3 een tabel met voorbeelden en werd hen gevraagd een ontbrekende waarde te voorspellen. Zonder enige fijnafstemming presteerden ze vergelijkbaar met gespecialiseerde programma's, en bij de Friedman #2-functie overtrof Claude 3 zelfs vijf van dergelijke tools. Interessant is dat het verhogen van het aantal voorbeelden de nauwkeurigheid verbeterde, wat niet aan geluk kan worden toegeschreven. Dit leren in de context is opmerkelijk omdat er geen extra training voor nodig is. LLM's zijn echter onbetrouwbaar: hun voorspellingen variëren met de volgorde van rijen en de precisie van getallen, en ze hebben geen plafond, waardoor ze soms extreem foute antwoorden geven. Ondanks dat ze per voorspelling een orde van grootte duurder zijn dan klassieke tools, blinken LLM's uit wanneer er weinig gegevens zijn, de gegevens tekst bevatten, of wanneer kolomnamen betekenis dragen. Nieuwe gespecialiseerde modellen zoals TabPFN, gepubliceerd in Nature begin 2025, presteren beter dan LLM's op puur numerieke tabellen met kleine datasets; ze doen er minder dan drie seconden over om een combinatie van klassieke methoden te verslaan die vier uur draaide. De aanbeveling is om LLM's alleen te gebruiken wanneer er weinig gegevens of betekenisvolle tekst is, en om ze te beschouwen als een aanvulling in plaats van een vervanging voor klassieke tools.
Bron: Habr — хаб ИИ —
origineel
