TAKC : Compression de connaissances orientée tâche pour l'IA d'entreprise sur AWS au lieu du RAG
Amazon Web Services
Anthropic
AWS a introduit une technique appelée « Compression de connaissances orientée tâche » (TAKC) qui répond aux limites de la génération augmentée par récupération (RAG) dans les tâches analytiques complexes impliquant des centaines de documents. TAKC pré-compresse l'ensemble de la base de connaissances en représentations concises et ciblées sur la tâche, permettant des insights transversaux aux documents et réduisant les coûts en tokens d'entrée de 8 à 64 fois.
Le blog AWS ML décrit une approche appelée TAKC (Task-aware Knowledge Compression, compression de connaissances adaptée à la tâche), conçue pour surmonter les limites de la RAG (Retrieval-Augmented Generation, génération augmentée par récupération) lors de l'exécution de tâches analytiques complexes portant sur des centaines de documents (par exemple, l'expertise financière ou la vérification de conformité réglementaire). TAKC utilise un LLM pour créer des résumés courts de documents, orientés vers une tâche spécifique, et pour des tâches différentes issues d'une même source, des représentations compressées distinctes sont générées. Le système prend en charge quatre niveaux de compression — de 8x (léger, pour les raisonnements multi-étapes) à 64x (ultra, pour la classification et la recherche par mots-clés). Un analyseur de complexité des requêtes oriente automatiquement les questions vers le niveau approprié.
L'infrastructure sur AWS se compose de deux pipelines sans serveur — l'un pour l'ingestion, l'autre pour les requêtes. Lors de l'ingestion, le document est découpé en segments (256 tokens avec un chevauchement de 50 tokens), qui sont compressés en parallèle via Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet et Amazon Titan Text). Les représentations compressées sont mises en cache dans Amazon ElastiCache Serverless et dupliquées dans S3. Lors d'une requête, l'utilisateur s'authentifie via Amazon Cognito, la requête transite par API Gateway et AWS WAF, une fonction Lambda analyse sa complexité, extrait le cache compressé approprié depuis ElastiCache et envoie le contexte compressé accompagné de la question à Bedrock. En cas de faible confiance dans l'orientation, un niveau de compression intermédiaire est utilisé.
Le coût d'une compression unique lors de l'ingestion est amorti par les requêtes multiples effectuées sur une base de connaissances rarement modifiée. TAKC et RAG peuvent être combinés : la RAG pour les requêtes de recherche rapide avec indication des sources, et TAKC pour les tâches analytiques où la RAG ne suffit pas. L'implémentation est fournie en open source (code source ouvert), déployable en une seule commande via AWS CDK.
Source: AWS ML blog —
original
