TAKC: Task-Oriented Knowledge Compression for Enterprise AI on AWS Instead of RAG
Amazon Web Services
Anthropic
AWS introduced a technique called "Task-Oriented Knowledge Compression" (TAKC) that addresses the limitations of Retrieval-Augmented Generation (RAG) in complex analytical tasks involving hundreds of documents. TAKC pre-compresses the entire knowledge base into concise, task-focused representations, enabling cross-document insights and reducing input token costs by 8–64 times.
AWS ML ब्लॉग में TAKC (Task-aware Knowledge Compression) दृष्टिकोण का वर्णन किया गया है, जो सैकड़ों दस्तावेज़ों को कवर करने वाले जटिल विश्लेषणात्मक कार्यों (जैसे वित्तीय जांच या अनुपालन ऑडिट) में RAG की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है। TAKC LLM का उपयोग करके कार्य-विशिष्ट, संक्षिप्त दस्तावेज़ सारांश बनाता है, जहां एक ही स्रोत से अलग-अलग कार्यों के लिए अलग-अलग संपीड़ित प्रतिनिधित्व तैयार किए जाते हैं। सिस्टम चार संपीड़न स्तरों का समर्थन करता है — 8x (हल्का, बहु-घटक तर्क के लिए) से 64x (अल्ट्रा, वर्गीकरण और कीवर्ड खोज के लिए) तक। एक क्वेरी जटिलता विश्लेषक स्वचालित रूप से प्रश्नों को उपयुक्त स्तर पर भेजता है। AWS पर बुनियादी ढांचे में दो सर्वर रहित पाइपलाइन शामिल हैं — इन्जेशन और क्वेरी। इन्जेशन के दौरान, दस्तावेज़ को 256 टोकन के चंक्स (50 टोकन ओवरलैप के साथ) में विभाजित किया जाता है, जिन्हें Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet और Amazon Titan Text) के माध्यम से समानांतर रूप से संपीड़ित किया जाता है। संपीड़ित प्रतिनिधित्व Amazon ElastiCache Serverless में कैश किए जाते हैं और S3 में डुप्लिकेट होते हैं। क्वेरी के दौरान, उपयोगकर्ता Amazon Cognito के माध्यम से प्रमाणित होता है, क्वेरी API Gateway और AWS WAF से गुज़रती है, एक Lambda फ़ंक्शन जटिलता का विश्लेषण करता है, ElastiCache से उपयुक्त संपीड़ित कैश प्राप्त करता है, और संपीड़ित संदर्भ को प्रश्न के साथ Bedrock को भेजता है। रूटिंग में कम आत्मविश्वास होने पर मध्यम संपीड़न स्तर का उपयोग किया जाता है। इन्जेशन के दौरान एक बार संपीड़न की लागत विरले ही बदलने वाले ज्ञान आधार पर कई प्रश्नों में वितरित हो जाती है। TAKC और RAG को संयोजित किया जा सकता है: RAG स्रोतों के साथ त्वरित लुकअप क्वेरी के लिए, और TAKC विश्लेषणात्मक क्वेरी के लिए जहां RAG विफल हो जाता है। कार्यान्वयन ओपन-सोर्स के रूप में उपलब्ध है, जिसे एक AWS CDK कमांड से तैनात किया जा सकता है।
स्रोत: AWS ML blog —
मूल
