TAKC:面向任务的知识压缩,替代RAG在AWS企业AI中的应用
Amazon Web Services
Anthropic
AWS引入了一种名为“面向任务的知识压缩”(TAKC)的技术,旨在解决检索增强生成(RAG)在处理涉及数百份文档的复杂分析任务时的局限性。TAKC将整个知识库预压缩为简洁、聚焦于任务的表示形式,从而实现跨文档洞察,并将输入令牌成本降低8至64倍。
AWS ML博客介绍了一种名为TAKC(任务感知知识压缩,Task-aware Knowledge Compression)的方法,旨在克服RAG在涉及数百份文档的复杂分析任务(例如,金融尽职调查或合规性审查)中的局限性。TAKC利用LLM为每个文档生成针对特定任务的简短摘要,针对同一来源的不同任务生成不同的压缩表示。该系统支持四个压缩级别——从8倍(轻度,适用于多步骤推理)到64倍(超度,适用于分类和关键词搜索)。一个查询复杂度分析器会自动将问题路由到合适的级别。AWS基础设施由两个无服务器管道组成——摄取管道和查询管道。在摄取时,文档被分割成块(256个token,重叠50个token),并通过Amazon Bedrock(Anthropic Claude 3 Haiku、Sonnet和Amazon Titan Text)并行压缩。压缩后的表示缓存到Amazon ElastiCache Serverless中,并复制到S3。查询时,用户通过Amazon Cognito进行身份验证,请求通过API Gateway和AWS WAF,Lambda函数分析复杂度,从ElastiCache中提取适当的压缩缓存,并将压缩后的上下文与问题一起发送到Bedrock。当路由置信度低时,使用中等压缩级别。一次性的摄取压缩成本通过对很少变化的知识库的多次查询得以摊销。TAKC和RAG可以结合使用:RAG用于快速查找式查询并附带来源引用,TAKC用于RAG无法处理的复杂分析。实现以开源形式提供,可通过一条AWS CDK命令部署。
来源: AWS ML blog —
原文
