大規模言語モデルをめぐる議論:LLMはより多用途になっているのか、それともより特化しているのか?
OpenAI
Anthropic
Alibaba/Qwen
Moonshot AI
Google DeepMind
OpenAIの元従業員であるアンドリュー・ホー氏は、大規模言語モデルの汎化能力に疑問を抱き、高品質なトレーニングデータのためのスタートアップを設立しました。彼の懐疑的な見方は、ケンブリッジ大学とGoogle DeepMindの研究者たちによって支持されており、彼らは現在のAIシステムが多用途ではなく、より特化していると観察しています。
Andrew Hoは8ヶ月でOpenAIを去り、その理由として、プログラミングのような資金が潤沢な分野でも大規模言語モデルの汎化が乏しく、能力にばらつきがあることを挙げた。彼は、既存のデータ提供には経済的に関連するスキルの大半がほとんど含まれていないため、問題はトレーニングデータの不足にあると考えている。Hoは、スケーリングだけでは不十分であり、AIラボはターゲットを絞ったデータ獲得に1000億ドル以上を費やす必要があると見積もっている。また、OpenAIやAnthropicのようなフロンティアラボの高評価には懐疑的で、彼らは慢性的に赤字であり、QwenやKimiのようなより安価な競合他社と競争するために常に投資し続けなければならないと指摘する。彼の最初の製品は、バイオインフォマティクスと日常の実験室業務のためのデータセットに焦点を当てており、GPT-5.6 Solのような現在のモデルでは成功率が約30%しか達成されていない。ケンブリッジ大学のAdam Huntもこの見解を支持し、最新のモデルはより専門化が進み、コーディングや複雑な数学では成長が見られる一方で、他の分野では停滞していると観察している。Google DeepMindのTom Zahavyは構造的な説明を提供し、言語モデルは演繹と帰納を習得するが、創造的仮説形成では失敗すると述べている。彼は、アクション制御可能なワールドモデルが可能な解決策であると示唆している。
出典: The Decoder (DE) —
原文
