TAKC: Task-Oriented Knowledge Compression for Enterprise AI on AWS Instead of RAG
Amazon Web Services
Anthropic
AWS introduced a technique called "Task-Oriented Knowledge Compression" (TAKC) that addresses the limitations of Retrieval-Augmented Generation (RAG) in complex analytical tasks involving hundreds of documents. TAKC pre-compresses the entire knowledge base into concise, task-focused representations, enabling cross-document insights and reducing input token costs by 8–64 times.
В блоге AWS ML описан подход TAKC (Task-aware Knowledge Compression), предназначенный для преодоления ограничений RAG при выполнении сложных аналитических задач, охватывающих сотни документов (например, финансовая экспертиза или проверка соответствия нормативным требованиям). TAKC использует LLM для создания коротких, ориентированных на конкретную задачу сводок документов, причём для разных задач из одного источника формируются разные сжатые представления. Система поддерживает четыре уровня сжатия — от 8x (лёгкое, для многокомпонентных рассуждений) до 64x (ультра, для классификации и поиска по ключевым словам). Анализатор сложности запросов автоматически направляет вопросы на подходящий уровень. Инфраструктура на AWS состоит из двух бессерверных конвейеров — приёмочного и запросного. При приёме документ разбивается на чанки (256 токенов с перекрытием 50 токенов), которые параллельно сжимаются через Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet и Amazon Titan Text). Сжатые представления кэшируются в Amazon ElastiCache Serverless и дублируются в S3. При запросе пользователь аутентифицируется через Amazon Cognito, запрос проходит через API Gateway и AWS WAF, Lambda-функция анализирует сложность, извлекает подходящий сжатый кэш из ElastiCache и отправляет сжатый контекст с вопросом в Bedrock. При низкой уверенности маршрутизации используется средний уровень сжатия. Стоимость однократного сжатия при приёме амортизируется при многократных запросах к редко изменяемой базе знаний. TAKC и RAG можно комбинировать: RAG для быстрых lookup-запросов с указанием источников, TAKC для аналитических, где RAG не справляется. Реализация предоставлена в виде открытого исходного кода, развёртываемого одной командой AWS CDK.
출처: AWS ML blog —
원문
