GPT-5.6 Lunaより11倍安い小型AIモデル、論理テストでほぼ同等の性能を達成
OpenAI
Anthropic
Google/DeepMind
Alibaba/Qwen
Pathway Labは、推論モデルBDH-CQのテスト結果を発表しました。このモデルは1億5000万パラメータを持ち、ARC-AGI-1ベンチマークで29.5%のスコアを獲得しました。計算コストはタスクあたり0.0007ドルで、タスクあたり0.008ドルで34.2%を獲得したOpenAIのGPT-5.6 Lunaより11倍安価です。同研究所は、代替アーキテクチャがコスト効率を大幅に改善できると主張しています。
Pathway Labは、Transformerとは異なるアーキテクチャに焦点を当てており、推論モデルBDH-CQの結果を公開した。わずか1億5000万パラメータであるにもかかわらず、ARC-AGI-1ベンチマークで29.5%を達成し、タスクあたりのコストはわずか0.0007ドルだった。これは、OpenAIの小型モデルGPT-5.6 Lunaよりも11倍安く、同モデルは34.2%のスコアで、80%の値下げ後でもタスクあたり0.008ドルかかった。比較として、Anthropic Claude Opus 5とGoogle Gemini 3.1 Proは同じテストで97~98%のスコアを獲得したが、タスクあたり0.5~0.6ドルと、ほぼ1000倍のコストがかかる。AlibabaのQwen3 235BはBDH-CQの3倍以上のコストがかかったが、性能は劣っていた。同研究所は、その差は推論メカニズムによるものだと述べている。現在のほとんどのAIモデルはトークンを消費する中間テキストを生成するが、BDH-CQはメモリ内で静かに問題を解く。初期の実験では、BDH-CQは10億から6000億パラメータのTransformerモデルに匹敵する標準的なスケーリング則に従うことが示された。Pathwayは、数学的推論、ARC-AGI-2テスト、そして最終的にはARC-AGI-3の完全な評価を含む、より困難なタスクに取り組む計画であり、この効率性の利点がより大規模で複雑な問題でも維持されることを期待している。
出典: 3DNews —
原文
