研究エージェント 🇺🇸 28.07.2026 00:04

LLMチャットボットに欠けているもの:目的意識

OpenAIOpenAI MetaMeta
現代のLLMチャットボットは1回限りのクエリには優れていますが、マルチターンの対話では集中力を失います。研究によれば、モデルはわずか数ラウンドの会話の後でシステムプロンプトから急速に逸脱します。著者は、長期的な目標と反復的な対話を考慮した「目的駆動型対話」アプローチを提案しています。
LLMチャットボットは絶えず改善されていますが、その進歩はMMLU、HumanEval、MATHなどのワンショット応答をテストするベンチマークで測定されています。しかし、旅行計画やGitHubの課題の自動化といった現実世界のタスクでは、要件を洗練させるためのマルチターン対話が必要です。研究者たちは、LLaMA2-chat-70BやGPT-3.5-turbo-16kのような高度なモデルでも、約1,600トークン(約16ラウンド)を超えるとシステムプロンプトへの遵守が失われることを示しています。これは、2つのLLMエージェントが互いに通信し、それぞれがどれだけ自分の指示に従ったかを確認する実験で確認されています。問題は、人間のフィードバックからの強化学習(Reinforcement Learning from Human Feedback、RLHF)によるトレーニングがマルチステップ計画を考慮していないことです。つまり、長期的な目標ではなく、ワンショット応答を最適化しているのです。著者は、チャットボットがユーザーの意図を徐々に明確にするアシスタントとして機能する「目標指向対話」アプローチを提案しています。このようなシステムの例としては、「ソリューション指向対話」や、協調的な意思決定をモデル化するSotopiaプラットフォームがあります。真のアシスタントを作成するには、テキストを生成するだけでなく、各発話が対話相手の世界モデルを変えるような、目標指向ゲームとして対話を設計する必要があります。
出典: The Gradient — 原文
関連記事 ↓
新着ニュース