TAKC: taskbewuste kenniscompressie voor enterprise AI op AWS, een aanpak die verder gaat dan RAG
Amazon Web Services
Anthropic
AWS introduceert taskbewuste kenniscompressie (TAKC), een techniek die volledige kennisbanken vooraf comprimeert tot taakspecifieke representaties voor enterprise AI. TAKC overwint de beperkingen van RAG bij redeneren over documenten heen, vermindert het aantal tokens met 8x tot 64x, terwijl taakrelevante informatie behouden blijft. De oplossing omvat compressieniveaus met meerdere snelheden en een serverloze architectuur op AWS.
AWS presenteert TAKC (task-aware knowledge compression, taakbewuste kenniscompressie) als alternatief voor RAG voor AI-taken in ondernemingen die redeneringen over meerdere documenten vereisen, zoals financiële due diligence of naleving van regelgeving. TAKC gebruikt een large language model (LLM) om kortere, taakgerichte samenvattingen van volledige documenten te genereren, met meerdere compressieniveaus (8x, 16x, 32x, 64x). Een querycomplexiteitsanalysator routeert vragen naar het juiste niveau. De implementatie op AWS gebruikt twee ontkoppelde serverloze pijplijnen: opname en query. Tijdens opname activeren documenten in S3 Lambda-functies die data chunken en comprimeren via Amazon Bedrock, en de resultaten opslaan in ElastiCache en S3. Het querypad gebruikt API Gateway, Cognito en Lambda om gecomprimeerde context op te halen en antwoorden te genereren. TAKC is ontworpen voor kennisbanken die niet vaak veranderen en complexe analytische queries vereisen. Het artikel bevat een kostprijsvergelijking waaruit blijkt dat TAKC het aantal inputtokens aanzienlijk kan verminderen in vergelijking met volledige context of RAG. AWS raadt aan om zowel TAKC als RAG in productie te gebruiken: RAG voor snelle opzoekingen, TAKC voor analytische queries.
Bron: AWS ML blog —
origineel
