任务感知知识压缩:在 AWS 上突破 RAG 局限
AWS 提出任务感知知识压缩(TAKC),将知识库按任务类型离线压缩为不同表示,查询时按复杂度路由至 4 个压缩层级,压…
AWS 机器学习团队在官方博客中提出「任务感知知识压缩」(Task-aware Knowledge Compression,下称 TAKC),旨在解决传统检索增强生成(RAG)在企业级复杂分析任务中的天花板问题。该方法通过 LLM 对整库文档做任务特定的离线压缩,查询时再按问题复杂度路由到不同压缩层级,并随博客提供可部署的开源实现。
传统 RAG 在跨文档分析中的瓶颈
RAG 的核心是相似度检索,但它只能定位「与问题字面相似」的片段,难以覆盖跨文档的逻辑关联。博客给出一个典型场景:一家私募基金评估一笔 5 亿美元的制造企业收购案,尽调团队需要交叉分析 12 家子公司 5 年的财务报表、200 余份供应商合同、8 个设施的环保合规报告以及 50 多宗诉讼。当分析师询问「综合财务风险如何受当前供应商条款和未决诉讼影响」时,相关信息分散在数百份文档中,片段之间不存在字面相似性,相似度检索无能为力。
任务感知知识压缩的核心思路
TAKC 的核心是用 LLM 为同一份文档生成不同任务维度的精简摘要,而非一份「面面俱到」的通用摘要。例如,同一份年报面向财务分析时保留营收、毛利率、现金流数据,面向合规审查时则只保留监管引用与违规历史。这种压缩按文档—任务组合离线执行一次,查询时直接检索预先生成的压缩表示,而不是原文。
系统在每种任务类型下保留 4 个压缩档位,按问题复杂度自动分流:
- 轻压缩(8 倍):上下文减少约 87.5%,保留多步推理与跨文档综合所需的细节。
- 中压缩(16 倍):上下文减少约 93.8%,适合中等复杂度的分析查询。
- 高压缩(32 倍):上下文减少约 96.9%,用于事实型查询与定义明确的问题。
- 超压缩(64 倍):上下文减少约 98.4%,适用于分类任务与关键词查找。
查询复杂度分析器根据问题长度、类型与是否包含分析性语言,把简单事实型问题路由到超压缩缓存,把复杂分析问题路由到轻压缩缓存,对用户透明。多数企业查询其实是查找类,可在高压缩档位低成本回答;少数复杂问题才消耗较大上下文预算。
AWS 上的无服务器架构
参考实现部署在 AWS 上,由解耦的两条无服务器流水线组成:
- 摄入流水线:文档进入 S3 后触发 Lambda,使用版本化、可审计的任务提示词生成任务特定的压缩表示,并按
takc:{task}:{rate}复合键写入 Amazon ElastiCache Serverless。 - 查询流水线:Amazon API Gateway 暴露 REST 接口,Amazon Cognito 负责 JWT 鉴权,Lambda 根据查询复杂度路由到对应压缩档位后生成回答。
AWS 选择 Lambda 的原因是摄入期是突发负载、查询期是波动负载,二者都属于事件驱动、短时运行的工作负载,与无服务器模型天然契合。提示词建议存放在 AWS Systems Manager Parameter Store 或专用 S3 前缀中,便于审计和触发重新压缩。
质量验证与定位
博客建议在每个档位上用 LLM 对比「压缩版本回答」与「原文回答」的一致性,参考实现包含针对具体任务类型和文档运行的测试脚本。TAKC 并非要取代 RAG 的全部优化手段,元数据过滤、查询改写等手段仍可在压缩前缩小候选文档集。整体上,TAKC 的定位是:在 RAG 之上,为跨文档、强任务导向的企业场景提供一条补充路径。
