AWS SageMaker 上线 WhisperX 容器,支持说话人分离转写
AWS 推出 WhisperX 深度学习容器,可在 SageMaker AI 上一键部署带说话人标签与字级时间戳的语音转…
AWS 近日在官方机器学习博客发布了一款面向 SageMaker AI 的 WhisperX 深度学习容器(DLC),将 OpenAI 开源语音识别模型 Whisper 与 wav2vec2 强制对齐、说话人 diarization 能力打包为可直接部署的 GPU 镜像,覆盖实时与异步两种端点模式,目标是把通用语音转写升级为「带说话人标签 + 字级时间戳」的结构化转写。
解决了什么通用转写的痛点
通用 ASR 在客服通话、全员会、播客、取证录音、广播素材等场景下经常翻车:时间戳只能到句级,误差达数秒;「谁说了什么」也无可靠答案。AWS 在博客中指出,时间戳不精确会让字幕和脱敏失败,缺失说话人标签则让合规审查难以进行。WhisperX 通过批量推理、wav2vec2 强制对齐和说话人聚类,把这两个缺口同时补上,使转写结果可直接用于话务量统计、脚本合规分析、会议检索、SRT/VTT 字幕生成与司法取证等场景。
容器形态与服务契约
AWS WhisperX DLC 是一个已预装 Whisper、对齐模型与 diarization 权重的 GPU 镜像,且无需 Hugging Face Token。容器遵循 SageMaker 标准服务契约:
- 端口 8080,提供 POST /invocations 与 GET /ping 两个接口;
- 请求采用 multipart/form-data,音频以文件形式上传,可附带 language、diarize、response_format 等可选字段;
- 输出支持 json、verbose_json、srt、vtt 四种格式,方便下游分析管线与视频编辑器直接消费。
实时与异步端点的取舍
同一份 DLC 可分别以实时或异步端点方式部署,AWS 给出明确建议:
- 实时端点:同步调用,需在 SageMaker 60 秒响应上限内完成,适合短音频与交互场景,调用方式为 InvokeEndpoint,按实例在线时长计费;
- 异步端点:通过 Amazon S3 中转输入输出,无响应时长限制,适合长音频与批量处理,支持缩容到零节省成本,调用方式为 InvokeEndpointAsync。
实例选型上,低成本可选 ml.g4dn.xlarge,需要更高算力可选 ml.g5.2xlarge;两者都需固定到带 GPU 的 AMI,吞吐靠增加实例数而非单实例并发来扩展。
部署前置条件
官方列出的最低要求包括:拥有可创建模型与端点的 SageMaker 执行角色、对应实例类型的 GPU 服务配额、从 Amazon ECR 拉取的 WhisperX DLC 镜像 URI(如 763104351884.dkr.ecr.<region>.amazonaws.com/whisperx:3.8.6-cu128-amzn2023-sagemaker),以及(异步场景下)名称含「sagemaker」的 S3 存储桶——默认 SageMakerFullAccess 策略仅对该类桶授予访问权限。AWS 表示完整的 JupyterLab 示例笔记本已发布在 AWS Samples 仓库,可在 SageMaker AI Studio 中直接运行。
更广的上下文
该篇是 AWS 多模态 DLC 系列博客之一,同一系列还覆盖 vLLM-Omni(文生语音)、vLLM-Omni(图视频理解)以及 llama.cpp。对企业用户而言,DLC 形态的价值在于省去自建 GPU 镜像、依赖管理与合规审查的负担,让 ASR 这类「应用层管道复杂、模型本身成熟」的负载更快落地。
