Gemini 3.8 Live 上线 Live Avatar 功能
Google DeepMind 为 Gemini 3.8 Live 推出 Live Avatar,将实时视频生成与语音对…
Google DeepMind 在 Gemini 3.8 Live 发布一周后,正式推出 Live Avatar 功能。该功能将实时视频生成与语音对话原生耦合,为企业级对话 AI 带来具备视觉形象的交互体验。Live Avatar 现已在 Gemini Enterprise 中上线,企业用户可在虚拟客服、互动导览等场景中使用。
多模态对话更自然
Live Avatar 的核心目标是还原面对面交流的多模态特性。系统可同时处理视觉与音频输入,并在近实时响应中输出带表情、口型同步的动态画面与语音,让企业智能体的对话过程从纯语音升级为「能听、能看、能说」的完整交互。该能力建立在 Gemini 原生实时对话模型之上,并未引入额外的拼接延迟。
支持异步工具调用
除了视觉呈现之外,Live Avatar 同样继承了 Gemini 的推理与工具调用能力。其异步工具调用机制允许模型在保持对话不中断的前提下,于后台触发工具、获取数据,从而处理酒店入住、订单查询等多步骤任务,确保对话流不会被外部请求阻塞。
面向全球的多语言适配
Live Avatar 内置原生多语言语音到语音同步能力,可在不同语种之间无缝切换,全程保持口型与表情一致,覆盖语言数量达 97 种,且不会因切换造成画质下降或视觉漂移。这一特性使其适用于跨境客服、国际化培训等需要频繁切换语言的场景。
可定制的企业形象
在形象层面,平台既提供多样化的预置虚拟形象,也支持企业基于高质量参考图生成专属动画化身,可在保留人物 likeness、品牌风格或角色特征的前提下生成可交互形象。目前自定义化身创建仅对企业白名单用户开放,尚未面向普通开发者。
安全保障与内容溯源
所有由 Live Avatar 生成的音频与视频均会嵌入 Google 的 SynthID 水印,用于标识 AI 生成内容,降低伪造与误传风险。Google 在模型卡中披露了完整的安全与负责任部署策略,强调身份保护与内容透明。
