エージェント研究 🇫🇷 10.08.2026 18:01

AIエージェント:エラーを並列化せずに作業を並列化する

OpenAIOpenAI AnthropicAnthropic
Anthropic を含む研究者による研究が、Horizon というベンチマークを導入し、3,100 を超えるエージェントの軌跡を分析しました。その結果、AI エージェントのパフォーマンスは、タスクの複雑さがある水準を超えると急激に低下する可能性があり、失敗の 72.5% がプロセス関連のリスクに起因することが示されました。Anthropic は、フェーズを分けるのではなく、独立したプロジェクトに分割することを推奨しています。
研究者らは、Horizonと名付けられたベンチマークを開発し、ウェブ、オペレーティングシステム、データベース、身体性環境など、さまざまな環境での3,100以上のエージェントの軌跡を分析しました。実験には、OpenAIとAnthropicのモデルを使用するエージェントが関与しました。調査結果によると、タスクが長くなるにつれてパフォーマンスは徐々に低下するのではなく、一定の水準を維持したまま、ある閾値を超えると突然崩壊することが明らかになりました。失敗には7つの主要なカテゴリーが特定され、2つのグループに分類されました。プロセス関連のリスクによる失敗が72.5%、エージェント設計リスクによる失敗が27.5%でした。Anthropicは「コンテキスト汚染」と呼ばれる現象を強調しています。これは、蓄積された中間情報がエージェントのコンテキストを散らかし、判断を損なうものです。この研究は、タスクを独立したサブタスクに分割し、それぞれを別のエージェントに処理させることが有効である一方、設計、実装、テストといったフェーズを分割すると、コンテキストを共有しすぎるため、伝言ゲームのように情報が失われることを示唆しています。経営者にとって、4つの質問が重要です。誰が決定を下したのか、どの情報に基づいて、どのようなコストで、そして失敗した単一のステップを独立して再生できるかどうか。再生可能性がなければ、インシデントはすべてをやり直すことになり、不適切な分割は単一エージェントの場合の3〜10倍のコストがかかる可能性があります。
出典: Le Monde Informatique — IA — 原文
関連記事 ↓
新着ニュース