おしゃべりなLLMエージェントから統治可能なシステムへ:アーキテクチャガイド
OpenAI
Google/DeepMind
Microsoft
Anthropic
LangChain
Mastra
CrewAI
KaibanJS
この記事は、LLMエージェントとマルチエージェントシステムの包括的なガイドで、ReActからグラフ、永続実行、サンドボックス化、メモリ、評価、本番環境でのセキュリティまでの戦略をカバーしています。開発者がいつ単一のエージェントで十分か、いつ複数のエージェントが有益か、そして最小限の実行可能なアーキテクチャを選択する方法を理解するのに役立ちます。このガイドは、現代のエージェントシステムが単一のライブラリではなく多層スタックであることを強調しています。
この記事は、開発者がエージェントシステムを理解するためのガイドであり、エージェントと通常のワークフローの違い、および単一または複数のエージェントを使用するタイミングを明確にしています。エージェントは、モデル+作業ループ+ツール+状態+ルールと制約として定義されることを概説しています。記事は、思考-行動-観察サイクルを導入したReActアプローチ(2022年)から、2023年にAutoGenによって普及した会話型アーキテクチャ、そして2024年のLangGraphのようなグラフベースの構造への進化をたどっています。多くのアプリケーションでは単一のエージェントで十分であり、マルチエージェント設定は、役割がコンテキスト、ツール、または権限において真に異なる場合にのみ利点をもたらすことを強調しています。また、記事はさまざまな戦略(ReAct、Plan-and-Solve、ReWOO、Tree of Thoughts、RAP、LATS、Self-Refine、Reflexion、MRKL)について説明し、ステップが事前に決定されているほど、モデルが必要とする自由度は低くなることに言及しています。同一の大規模言語モデル呼び出しがチームであるかのように振る舞う「エージェントシアター」の概念を紹介し、決定論的ロジック(コード)と確率論的ロジック(大規模言語モデルの決定)を分離することの重要性を強調しています。最後に、エージェントSDK、グラフランタイム、メモリ、サンドボックス、可観測性などのレイヤーを含む現代のエージェントスタックを提示し、OpenAI Agents SDK、Google ADK、LangGraph、Mastraなどの例を挙げています。
出典: Habr — хаб ИИ —
原文
