Mesin yang Tidak Bisa Menghitung tetapi Menebak Angka
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
Model bahasa (LLM) dapat memprediksi nilai numerik dari data tabel tanpa penyesuaian halus, terkadang menyaingi atau bahkan mengungguli alat regresi khusus. Namun, mereka memiliki keterbatasan mendasar: mereka memperlakukan angka sebagai teks, kurang interpretabilitas, dan mahal. Model baru yang berfokus pada tabel seperti TabPFN mengungguli LLM pada tabel numerik murni.
Artikel ini mengeksplorasi mengapa model bahasa besar (LLM) dapat memprediksi kuantitas numerik meskipun tidak benar-benar memahami angka. Berbeda dengan alat regresi tradisional seperti XGBoost, yang menggunakan pendekatan pohon keputusan, LLM memproses angka sebagai string karakter, memecahnya menjadi token secara arbitrer. Dalam eksperimen tahun 2024 oleh peneliti dari University of Arizona dan Technical University of Cluj-Napoca, LLM seperti GPT-4 dan Claude 3 diberi tabel contoh dan diminta memprediksi nilai yang hilang. Tanpa penyesuaian halus (fine-tuning) apa pun, mereka berkinerja sebanding dengan program khusus, dan pada fungsi Friedman #2, Claude 3 bahkan melampaui lima alat tersebut. Menariknya, menambah jumlah contoh meningkatkan akurasi, yang tidak dapat dikaitkan dengan keberuntungan. Pembelajaran dalam konteks (in-context learning) ini luar biasa karena tidak memerlukan pelatihan tambahan. Namun, LLM tidak dapat diandalkan: prediksi mereka bervariasi dengan urutan baris dan presisi angka, dan mereka tidak memiliki batas atas, terkadang memberikan jawaban yang sangat salah. Meskipun biaya per prediksi lebih mahal hingga orde besaran dibandingkan alat klasik, LLM unggul ketika data langka, mengandung teks, atau ketika nama kolom memiliki makna. Model khusus baru seperti TabPFN, yang diterbitkan di Nature pada awal 2025, mengungguli LLM pada tabel numerik murni dengan data kecil, hanya membutuhkan waktu kurang dari tiga detik untuk mengalahkan kombinasi metode klasik yang berjalan selama empat jam. Rekomendasinya adalah gunakan LLM hanya jika datanya sedikit atau ada teks yang bermakna, dan anggap mereka sebagai pelengkap, bukan pengganti, untuk alat klasik.
Sumber: Habr — хаб ИИ —
asli
