数えられないが数値を推測する機械
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
言語モデル(大規模言語モデル、LLM)は、微調整なしで表形式データから数値を予測でき、場合によっては専用の回帰ツールに匹敵またはそれを上回ることもあります。しかし、数値をテキストとして扱うため、解釈可能性に欠け、コストがかかるという根本的な限界があります。TabPFNのような表に特化した新しいモデルは、純粋な数値テーブルではLLMを上回ります。
この記事では、大規模言語モデル(LLM)が数値を真に理解していないにもかかわらず、数値量を予測できる理由を探る。XGBoostのような従来の回帰ツールが決定木アプローチを用いるのに対し、LLMは数値を文字列として処理し、任意にトークンに分割する。2024年にアリゾナ大学とクルジュ=ナポカ工科大学の研究者らが行った実験では、GPT-4やClaude 3などのLLMに例の表を与え、欠損値を予測するよう求めた。ファインチューニングなしで、それらは専用プログラムに匹敵する性能を示し、Friedman #2関数では、Claude 3は5つのツールを上回った。興味深いことに、例の数を増やすと精度が向上し、これは偶然では説明できない。この文脈内学習は、追加のトレーニングを必要としない点で注目に値する。しかし、LLMは信頼性に欠ける:予測は行の順序や数値の精度によって変動し、上限がなく、時には大きく外れた答えを出すこともある。1回の予測あたりのコストは古典的ツールよりも桁違いに高いが、LLMはデータが少ない場合、テキストが含まれる場合、または列名が意味を持つ場合に力を発揮する。TabPFNのような新しい専用モデルは、2025年初頭にNatureに掲載され、小規模なデータの純粋な数値表でLLMを上回り、4時間実行された古典的手法の組み合わせを3秒未満で打ち負かした。推奨事項は、データが少ないか意味のあるテキストがある場合にのみLLMを使用し、古典的ツールの代替ではなく補完と考えることである。
出典: Habr — хаб ИИ —
原文
