コーディングエージェントの6つの主要コンポーネント:現代のAIシステムがコードを書く仕組み
Anthropic
OpenAI
コーディングエージェントは、LLMとツール、メモリ、リポジトリのコンテキストを統合し、単純なチャットインターフェースよりも優れたパフォーマンスを発揮します。著者は、ライブリポジトリコンテキスト、プロンプト形状とキャッシュ再利用、バリデーション付き構造化ツール、コンテキスト削減、トランスクリプトとメモリ、サブエージェントによる委譲の6つの主要な構成要素を特定しています。周辺システム自体がモデルと同じくらい重要であることが多いです。
詳細な記事の中で、Sebastian Raschkaは自身のMini Coding Agentを具体例として用い、コーディングエージェントとハーネスの設計について解説しています。彼は大規模言語モデル(LLM)、推論モデル、エージェント、エージェントハーネスを区別しています。6つの核となる構成要素は以下の通りです。1)ライブリポジトリコンテキスト(gitブランチやREADMEなどのワークスペース情報を収集)、2)プロンプトの形状とキャッシュ再利用(安定したプレフィックスと動的部分を分離して再処理を回避)、3)検証と権限を持つ構造化ツール(引数が検証され安全チェックが行われた既知のツール)、4)コンテキスト削減と出力管理(無関係な履歴を切り捨てて肥大化を抑制)、5)トランスクリプト、メモリ、再開(セッションストア、短期記憶、タスク再開機能)、6)委任と境界付きサブエージェント(サブエージェントに作業を委任できるツール)。著者はまた、現代のLLMは同様の基本的な能力を持つため、ハーネスがモデル間の差別化要因になり得ると述べています。
出典: Sebastian Raschka —
原文
