Deepgram 在 SageMaker AI 上线增强可观测性
Deepgram 为其 SageMaker AI 端点推出 Enhanced Metrics 计费指标和 Prometh…
Deepgram 近日宣布在其 Amazon SageMaker AI 部署中推出两项新的可观测性能力——Deepgram Enhanced Metrics 与 Prometheus / OpenTelemetry 支持。这两项更新面向在 SageMaker AI 上以实时端点形式运行 Deepgram 语音转文本(STT)和文本转语音(TTS)模型的用户,目的是弥补自托管语音 AI 在计费透明度、特征用量与引擎内部行为上的观测盲区。
背景:自托管语音 AI 的观测短板
传统自托管语音服务的可观测性存在固有的取舍:平台通常只能告诉你端点是否在线、收到了多少请求;而真正驱动容量规划与成本管理的关键信息——计费单位、流量使用了哪些特性、推理引擎在每块 GPU 上做了什么——往往被封装在厂商的容器内部。对于需要数据驻留与合规的客户来说,把 Deepgram 模型部署在自己的 AWS 账户中是常见选择,但网络隔离也让厂商层面的遥测数据难以外推。
能力一:Deepgram Enhanced Metrics
Deepgram Enhanced Metrics 是 Deepgram 容器直接发布到用户 CloudWatch 账户的用量与计费指标,无需额外部署 agent 或 sidecar,也无需额外 IAM 权限。具体实现路径是:Deepgram 容器将 CloudWatch Embedded Metric Format(EMF)记录写入 stdout,CloudWatch Logs 自动将其抽取为指标。
该能力带来以下收益:
- 不需要部署额外的采集组件;
- 不增加端点原有 IAM 权限之外的访问;
- 在 AWS Marketplace 网络隔离下仍可工作,因为指标沿用 SageMaker 到 CloudWatch 的既有日志通道;
- 生成的指标属于标准 CloudWatch 指标,可直接用于 dashboard、告警和 metric math。
指标维度涵盖 Category、Model 与 Transport,但不含端点名称或实例 ID,因此无法对单一端点做过滤。涉及的主要指标包括:
- ConsumedUnits:每次请求的可计费推理单位,按时间求和即为总账单量;
- AudioDurationSeconds:处理的音频时长(STT);
- CharCount:合成的字符数(TTS)。
ConsumedUnits 的取值与 AWS Marketplace 的计量计费口径完全一致,用户可以按 Category、Model、Transport 三个粒度对账单进行逐项核对。
能力二:Prometheus 与 OpenTelemetry 支持
除了计费层面的指标,Deepgram 还开放了引擎级别的 Prometheus 指标,包括每块 GPU 加速器和宿主机指标。采集通过 SageMaker AI 的 detailed observability 完成,可以使用 PromQL 在 CloudWatch、Grafana 或任何兼容 Prometheus 的工具中查询。对于需要按端点、实例或 GPU 维度做细粒度拆解的场景,Prometheus 指标是首选。
需要注意的是,SageMaker AI 自身也提供名为 enhanced metrics 的端点特性(MetricsConfig 中的 EnableEnhancedMetrics),用于为标准端点指标增加每实例、每 GPU 的利用率维度。该功能与本文所述的 Deepgram Enhanced Metrics 是两个不同但互补的能力。
如何开始使用
两项能力均已上线,所有在 SageMaker AI 上部署的 Deepgram 端点可直接启用。用户只需:
- 在现有 Deepgram SageMaker AI 端点上确认 CloudWatch 日志组已开启;
- 按照 Deepgram 的 SageMaker observability guide 启用 SageMaker AI 的详细可观测性配置;
- 在 CloudWatch 中查看 Deepgram/SageMakerInference 命名空间下的指标,或通过 Prometheus 抓取引擎级指标。
对于需要把 Deepgram 用量与 AWS Marketplace 月度账单严格对账、或者需要逐 GPU 监控推理性能的用户,这两项更新填补了过去只能依赖厂商控制台的观测空白。
