RisetAplikasi 🇺🇸 27.07.2026 20:02

TAKC: Task-Oriented Knowledge Compression for Enterprise AI on AWS Instead of RAG

Amazon Web ServicesAmazon Web Services AnthropicAnthropic
AWS introduced a technique called "Task-Oriented Knowledge Compression" (TAKC) that addresses the limitations of Retrieval-Augmented Generation (RAG) in complex analytical tasks involving hundreds of documents. TAKC pre-compresses the entire knowledge base into concise, task-focused representations, enabling cross-document insights and reducing input token costs by 8–64 times.
Blog AWS ML menjelaskan pendekatan TAKC (Task-aware Knowledge Compression) yang dirancang untuk mengatasi keterbatasan RAG (Retrieval-Augmented Generation) dalam menangani tugas analitis kompleks yang melibatkan ratusan dokumen (misalnya, audit keuangan atau pemeriksaan kepatuhan regulasi). TAKC menggunakan large language model (LLM) untuk membuat ringkasan dokumen yang pendek dan spesifik terhadap tugas, di mana untuk tugas yang berbeda dari sumber yang sama dihasilkan representasi terkompresi yang berbeda. Sistem ini mendukung empat tingkat kompresi — dari 8x (ringan, untuk penalaran multikomponen) hingga 64x (ultra, untuk klasifikasi dan pencarian kata kunci). Penganalisis kompleksitas kueri secara otomatis mengarahkan pertanyaan ke tingkat yang sesuai. Infrastruktur di AWS terdiri dari dua pipeline tanpa server — pipeline penerimaan dan pipeline kueri. Saat penerimaan, dokumen dipecah menjadi chunk (256 token dengan overlap 50 token), yang kemudian dikompresi secara paralel melalui Amazon Bedrock (Anthropic Claude 3 Haiku, Sonnet, dan Amazon Titan Text). Representasi terkompresi disimpan dalam cache di Amazon ElastiCache Serverless dan diduplikasi di Amazon Simple Storage Service (S3). Saat kueri, pengguna diautentikasi melalui Amazon Cognito, kueri melewati Amazon API Gateway dan AWS WAF (Web Application Firewall), fungsi AWS Lambda menganalisis kompleksitas, mengambil cache terkompresi yang sesuai dari ElastiCache, dan mengirimkan konteks terkompresi beserta pertanyaan ke Bedrock. Jika keyakinan perutean rendah, digunakan tingkat kompresi sedang. Biaya kompresi satu kali saat penerimaan diamortisasi dengan banyaknya kueri ke basis pengetahuan yang jarang berubah. TAKC dan RAG dapat dikombinasikan: RAG untuk kueri pencarian cepat dengan menyebutkan sumber, TAKC untuk tugas analitis di mana RAG tidak memadai. Implementasi disediakan sebagai kode sumber terbuka yang dapat digunakan dengan satu perintah AWS CDK (Cloud Development Kit).
Sumber: AWS ML blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru