TAKC: Task-Oriented Knowledge Compression for Enterprise AI on AWS Instead of RAG
Amazon Web Services
Anthropic
AWS introduced a technique called "Task-Oriented Knowledge Compression" (TAKC) that addresses the limitations of Retrieval-Augmented Generation (RAG) in complex analytical tasks involving hundreds of documents. TAKC pre-compresses the entire knowledge base into concise, task-focused representations, enabling cross-document insights and reducing input token costs by 8–64 times.
AWS MLブログでは、RAGの限界を克服するためのアプローチとして、TAKC(Task-aware Knowledge Compression、タスク対応知識圧縮)が紹介されています。これは、財務デューデリジェンスやコンプライアンス審査など、数百もの文書にわたる複雑な分析タスクを対象としています。TAKCはLLMを使用して、タスクに特化した短い文書サマリーを生成し、同じソース文書からタスクごとに異なる圧縮表現を作り出します。システムは8倍(軽度、多段階推論向け)から64倍(超圧縮、分類やキーワード検索向け)までの4段階の圧縮レベルをサポートしています。クエリ複雑性アナライザーが質問を自動的に適切な圧縮レベルに振り分けます。AWS上のインフラは、インジェストパイプラインとクエリパイプラインの2つのサーバーレスパイプラインで構成されています。インジェスト時には、文書がチャンク(256トークン、50トークン重複)に分割され、Amazon Bedrock(Anthropic Claude 3 Haiku、Sonnet、Amazon Titan Text)を通じて並列圧縮されます。圧縮表現はAmazon ElastiCache Serverlessにキャッシュされ、S3にもバックアップされます。クエリ時には、ユーザーはAmazon Cognitoで認証され、リクエストはAPI GatewayとAWS WAFを通過し、Lambda関数が複雑性を分析してElastiCacheから適切な圧縮キャッシュを取得し、圧縮コンテキストと質問をBedrockに送信します。ルーティングの信頼度が低い場合、中間の圧縮レベルが使用されます。インジェスト時の圧縮コストは、頻繁に変更されないナレッジベースへの複数クエリで償却されます。TAKCとRAGは組み合わせ可能で、RAGは出典を示す高速ルックアップクエリに、TAKCはRAGでは対処できない分析クエリに使用します。実装はオープンソースとして提供され、AWS CDKの1コマンドでデプロイできます。
出典: AWS ML blog —
原文
