AWS 推出智能体对话式视频智能方案
AWS 发布基于智能体架构的视频问答方案,用自然语言检索视频内容,整合 Bedrock、Rekognition 与 Tr…
随着企业视频数据持续增长,媒体、安防、保险、专业服务等行业普遍面临「录得多、看不完」的困境:会议录像堆积在共享盘中,安防摄像头产出数周未被审看的素材,外勤检查视频在初次审核后长期沉淀在对象存储里。这些视频中往往蕴含高价值信息——三周前讨论过的设计决策、某人抵达门口的确切时刻、车辆碰撞前的事件序列——但传统上只能靠人工逐小时回看,而为每一类问题搭建定制机器学习流水线又意味着高额开发成本。AWS 在官方博客中分享了一种基于智能体(agentic)架构的解决方案,让用户能够用自然语言直接提问视频内容,并在数秒内得到答案。
方案核心思路
方案的关键是放弃为每类问题预构建固定流水线,而是使用 Strands Agents SDK 创建单一 AI 智能体,根据用户提问在运行时决定调用哪些 AWS 服务。具体分工如下:
- Amazon Transcribe:负责语音内容相关的问题,支持超过 100 种语言的自动识别与说话人分离。
- Amazon Rekognition:处理视频画面中物体、场景、活动与人脸的检测与匹配。
- Amazon Bedrock Data Automation(BDA):提供视频摘要、章节检测与完整转写的一体化分析路径,可在 Rekognition 或 Transcribe 不可用时作为替代。
- Amazon Bedrock:作为底层大模型推理引擎,由 Claude Sonnet 等支持工具调用的模型驱动智能体。
这种「运行时由模型决定路由」的设计,使系统无需为每个用例维护独立处理流水线,同一套架构可同时回答「会议里有哪些决定」「这个人出现过吗」「碰撞前哪辆车变道了」等异质问题。
性能与客户案例
对于已经分析过的内容,系统响应时间在 1 秒以内;首次分析新视频则视时长与所调用服务不同,通常需要 5–10 分钟。智能体会保留对话历史,用户的追问可在已有分析结果上直接复用,避免重复计算。
AWS 在与某大型媒体娱乐公司合作时落地了这一方案。该公司的咨询顾问需要对历史发现会议(discovery session)的录像进行检索,提取设计决策、行动项与各方立场。根据该客户内部对分析员人均审看时长的前后对比(未经 AWS 独立核验),方案在 200 多份多小时录像的积压审查中,将人工审看时间减少约 80%。
架构与前置条件
整体架构由智能体编排器(基于 Strands Agents SDK 与 Bedrock)和多个 AWS AI 服务组成,Amazon S3 提供上传视频与缓存分析结果的存储,并通过按用户前缀的方式实现多租户隔离。智能体编排器接收自然语言查询,决定调用哪些工具,必要时串联多个服务调用,并将结果合成为对话式回复。
要在本地跟随博客复现该方案,需要满足以下前置条件:
- 一个可访问 Amazon Bedrock(启用 Anthropic Claude Sonnet)与 Amazon S3 的 AWS 账号;如需文档处理,还需开通 Amazon Bedrock Data Automation 或同时具备 Rekognition 与 Transcribe。
- Python 3.11 及以上版本,并通过 pip 安装 strands-agents 与 strands-agents-tools。
- 已配置好对应服务权限的 AWS CLI。
- 对智能体工具调用与推理循环等概念有基本了解。
Rekognition、Transcribe 与 BDA 是这套方案的起始服务集,而非固定清单。由于智能体在运行时决定调用链路,后续可根据业务需要扩展更多分析能力,而无需重写应用代码。完整实现代码已在配套 GitHub 仓库中开放。
