InvestigaciónAplicaciones 🇺🇸 27.07.2026 20:02

TAKC: Compresión de Conocimiento Orientada a Tareas para IA Empresarial en AWS en lugar de RAG

Amazon Web ServicesAmazon Web Services AnthropicAnthropic
AWS presentó una técnica llamada "Compresión de Conocimiento Orientada a Tareas" (TAKC) que aborda las limitaciones de la Generación Aumentada por Recuperación (RAG) en tareas analíticas complejas que involucran cientos de documentos. TAKC precomprime toda la base de conocimiento en representaciones concisas y centradas en la tarea, permitiendo obtener información entre documentos y reduciendo los costos de tokens de entrada entre 8 y 64 veces.
El blog de AWS ML describe el enfoque TAKC (Task-aware Knowledge Compression, compresión de conocimiento orientada a tareas), diseñado para superar las limitaciones de RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) en la ejecución de tareas analíticas complejas que abarcan cientos de documentos (por ejemplo, peritajes financieros o verificación del cumplimiento normativo). TAKC utiliza un LLM (Large Language Model, modelo de lenguaje de gran tamaño) para crear resúmenes breves de documentos orientados a una tarea concreta, de modo que para distintas tareas se generan diferentes representaciones comprimidas a partir de una misma fuente. El sistema admite cuatro niveles de compresión —desde 8x (ligero, para razonamientos con múltiples componentes) hasta 64x (ultra, para clasificación y búsqueda por palabras clave)—. Un analizador de complejidad de consultas dirige automáticamente las preguntas al nivel adecuado. La infraestructura en AWS consta de dos flujos sin servidor (serverless): uno de ingesta y otro de consulta. Durante la ingesta, el documento se divide en fragmentos (chunks) de 256 tokens con un solapamiento de 50 tokens, que se comprimen en paralelo mediante Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet y Amazon Titan Text). Las representaciones comprimidas se almacenan en caché en Amazon ElastiCache Serverless y se duplican en S3. En el momento de la consulta, el usuario se autentica a través de Amazon Cognito, la solicitud pasa por API Gateway y AWS WAF, una función Lambda analiza la complejidad, recupera de ElastiCache la caché comprimida adecuada y envía el contexto comprimido junto con la pregunta a Bedrock. Cuando la confianza en el enrutamiento es baja, se utiliza un nivel de compresión intermedio. El costo de la compresión única durante la ingesta se amortiza a lo largo de múltiples consultas a una base de conocimiento que se modifica con poca frecuencia. TAKC y RAG pueden combinarse: RAG para consultas rápidas de búsqueda directa con indicación de fuentes, y TAKC para tareas analíticas donde RAG resulta insuficiente. La implementación se ofrece como código abierto, desplegable con un único comando de AWS CDK (Cloud Development Kit, kit de desarrollo en la nube).
Fuente: AWS ML blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas