模型发布
DeepMind 发布 SL2T 手语翻译模型,落地 Pixel 11 Gboard
DeepMind 推出支持 50 多种手语的 SL2T 模型,率先在 Pixel 11 Gboard 与 Live Tr…
2026.08.12 · 周三约 3 分钟阅读
Google DeepMind 正式推出大规模多语言手语转文本模型 SL2T(Sign Language-to-Text),并将其首次落地到消费级产品中。SL2T 已在 Pixel 11 的 Gboard 与 Live Transcribe 中提供「手语输入」功能,目前支持美国手语(ASL)转英语,更多设备与语言后续将陆续上线。该模型基于超过 10 万小时、覆盖 50 多种手语的数据训练而成,其中约四分之一为 ASL 数据。
核心能力与产品形态
SL2T 让听障用户可以像健听人士使用语音听写一样,在手机上「手语输入」完成文字任务,包括:
- 在任何需要打字的场景下,通过手语进行搜索、撰写消息或文档;
- 在 Live Transcribe 对话中以手语回复,而无需反复切换键盘输入;
- 向 Gemini 发起查询或执行任务。
DeepMind 表示,参与测试的用户反馈称,用 ASL 手语输入比英语打字更流畅、更自然,体验也更有趣。
为什么手语 AI 比语音识别更难
手语与口语在结构上存在根本差异,给 AI 带来两大挑战:
- 语音转录本质上是同一语言内的声学到文本的序列映射,而手语是独立的自然语言,拥有自己的语法与词汇,需要完整的机器翻译,而非逐词对应。
- 手语通过手、手臂、躯干、头部与面部的协调动作同时表达意义,对高频、精细的全身动作追踪是计算量极大的计算机视觉任务。
DeepMind 指出,早期的手语手套等产品受限于「英语搬到手」式的思路,难以处理手语作为全形态语言的复杂性。
技术方案:以骨架坐标替代视频
SL2T 在设计与工程上做了多项关键选择:
- 数据规模:训练数据覆盖 50 多种手语、不同方言与熟练度,通过多语联合训练学习共享结构,实验显示其效果优于单语言模型。
- 隐私保护:本地 MediaPipe Holistic 模型实时提取手语者的身体关键点坐标,仅将几何坐标上传服务器进行翻译,原始视频可立即丢弃。
- 跳过 Glosses:未使用传统手语翻译中的「gloss」(逐词标注)作为中间步骤,直接从坐标序列翻译为文本,避免 gloss 对非手部标记、空间结构等非线性特征的损失,并消除人工词表带来的覆盖上限。
基准与落地考量
在衡量 ASL 转英语质量的 FLEURS-ASL(sd-test)基准上,SL2T 取得 70 BLEURT 的零样本成绩,显著高于此前已报告的分数,是目前最强的公开手语翻译模型。但 DeepMind 同时强调,学术指标并不能直接等同于真实可用性,因此团队在以下方面做了大量工程优化:
- 降低流式延迟;
- 抑制非手语输入时的「幻觉」;
- 针对约 10% 的左撇子手语者保证公平性;
- 改善单手手语(另一只手持手机时)的识别表现。
此次发布标志着 DeepMind 将手语 AI 从实验室阶段推向消费级应用,全球逾 70 万听障与重听人士有望成为直接受益者。
