из одного источника формируются разные сжатые представления. Система поддерживает четыре уровня сжатия — от 8x (лёгкое, для многокомпонентных рассуждений) до 64x (ультра, для классификации и поиска по ключевым словам). Анализатор сложности запросов автоматически направляет вопросы на подходящий уровень. Инфраструктура на AWS состоит из двух бессерверных конвейеров — приёмочного и запросного. При приёме документ разбивается на чанки (256 токенов с перекрытием 50 токенов), которые параллельно сжимаются через Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet и Amazon Titan Text). Сжатые представления кэшируются в Amazon ElastiCache Serverless и дублируются в S3. При запросе пользователь аутентифицируется через Amazon Cognito, запрос проходит через API Gateway и AWS WAF, Lambda-функция анализирует сложность, извлекает подходящий сжатый кэш из ElastiCache и отправляет сжатый контекст с вопросом в Bedrock. При низкой уверенности маршрутизации используется средний уровень сжатия. Стоимость однократного сжатия при приёме амортизируется при многократных запросах к редко изменяемой базе знаний. TAKC и RAG можно комбинировать: RAG для быстрых lookup-запросов с указанием источников, TAKC для аналитических, где RAG не справляется. Реализация предоставлена в виде открытого исходного кода, развёртываемого одной командой AWS CDK.