Meta AI、長いタスクの進行を維持する第2のAIエージェントを提案
Meta
Anthropic
Meta AIの研究者らは、メモリモジュールを開発しました。このモジュールは、別の「メモリエージェント」を使用して、長いタスク中に「アクションエージェント」へ選択的にリマインダーを注入し、「行動状態の劣化」を防ぎます。Terminal-Bench 2.0とτ2-Benchでのテストでは、特に性能の低いエージェントで顕著な改善が見られ、コードはGitHubでオープンソース化されています。
Meta AIの研究者らは、論文の中で、AIエージェントが長いタスク中に要件を見失ったり、失敗した行動を繰り返したりするという繰り返し発生する問題について述べており、これを「行動状態の劣化」と呼んでいる。彼らは、プラグアンドプレイのメモリモジュールを提案している。これは、変更されていない「アクションエージェント」と並行して実行される別の「メモリエージェント」を実行し、一定間隔で最近のステップを観察し、構造化されたメモリバンクを更新し、次のアクション呼び出しに簡潔でメモリベースのリマインダーを注入するか、沈黙を保つかを決定する。メモリバンクは、プライベートステータス、知識、手続き的メモリに分割され、エージェントは自由な書き換えではなく、事前定義されたツール呼び出しを通じてバンクを管理する。テストはTerminal-Bench 2.0とτ2-Benchで実施され、メモリエージェントとしてClaude Opus 4.6が使用された。アクションエージェントとしてClaude Sonnet 4.5を使用した場合、システムはTerminal-Benchタスクの46%を最初の試行で解決し、38%から向上し、τ2-Benchのタスク加重平均は55%から62%に改善された。注目すべきドメインの違いとして、AirlineとRetailはそれぞれ約10パーセントポイント向上したが、Telecomはわずか3ポイントの向上にとどまった。より強力なOpus 4.6も改善されたが、その程度は小さく、その利点は単に容量不足を補うだけではないことを示唆している。アブレーション研究により、選択的介入と維持されたメモリバンクが鍵であり、このアプローチは生産的メモリレイヤーであるMem0よりも優れていることが示された。チームはまた、オープンモデルであるQwen3.5-27Bをメモリエージェントとして訓練することも検討し、介入を適切に調整するには教師あり微調整と強化学習が必要であることを発見した。Meta AIはコードをGitHubで公開した。
出典: The Decoder (DE) —
原文
