プロンプトインジェクションはフィルタでは解決しない:アーキテクチャパターンを使用した信頼できないテキストの隔離方法
OpenAI
Anthropic
Google DeepMind
Microsoft
プロンプトインジェクションはLLMアプリケーションにおける構造上の欠陥であり、システムプロンプトや分類器では修正できません。Dual-LLM、Google DeepMindのCaMeL、MetaのAgents Rule of Twoなどのアーキテクチャパターンが堅牢な隔離を提供します。この記事では、脅威モデル、Microsoft 365 CopilotにおけるEchoLeak脆弱性、そして3つの隔離モデルを用いた具体的な実装について詳しく説明しています。
プロンプトインジェクションは、2022年9月にSimon Willison氏によって紹介された攻撃で、LLMのコンテキスト内の信頼できないテキストが命令として実行される現象です。ジェイルブレイクとは異なり、これはモデルがツールやデータにアクセスできるアプリケーションに影響を及ぼし、Confused Deputy攻撃やデータ漏洩攻撃につながります。この記事では、システムプロンプトやガードレール分類器は効果がなく、OpenAI、Anthropic、Google DeepMindによる2025年の研究で、適応型攻撃が12の公開された防御策を90%以上の成功率で回避したと指摘しています。Simon Willison氏の「リーサル・トリフェクタ(Lethal Trifecta)」は、データ漏洩のための3つの要素、すなわちプライベートデータへのアクセス、信頼できないコンテンツとの接触、そして外部への送信チャネルを特定しています。Microsoft 365 CopilotのEchoLeak脆弱性(CVE-2025-32711)は、これら3つすべてを悪用しました。Metaの「エージェントのルール・オブ・ツー(Agents Rule of Two)」は、エージェントが「信頼できない入力の処理」「機密システム/データへのアクセス」「状態変更または外部通信の能力」という3つの特性のうち、2つ以上を持つべきではないと述べています。Dual-LLM(Willison, 2023)のようなアーキテクチャでは、特権LLM(ツールを持ち、信頼できる入力のみを見る)と隔離LLM(ツールを持たず、信頼できないテキストを処理する)を分離し、決定論的なコントローラで接続します。Google DeepMindのCaMeL(2024)は、検証器を使用して、隔離モデルが許可されたトークンの厳密なサブセットのみを出力するように強制します。2025年の論文による6つのプロジェクトパターンがこのアイデアを拡張しています。具体的な実装として、FAQ生成器のために3つの分離されたモデルが説明されています。1つは会社のデータとツールにアクセスできる特権モデル、1つは信頼できないページテキスト用の隔離モデル、そしてもう1つは合成用のモデルで、それらの間には決定論的なチェックが配置されています。
出典: Habr — хаб ИИ —
原文
