桃子桃子快讯
返回首页
行业动态

AI 语音克隆首入美国死刑量刑听证 辩方专家联名反对

美国犹他州一起数十年前谋杀案的量刑听证中,检方拟用 ElevenLabs 生成受害者语音 AI 克隆,辩方两名 AI 学…

2026.08.11 · 周二3 分钟阅读

1985 年遭绑架杀害的乔伊斯·约斯特(Joyce Yost)遗体始终未被发现,但凶手道格拉斯·洛弗尔(Douglas Lovell)早在 1993 年的辩诉谈判中已承认杀人,并两度被判处死刑、又两度因上诉被推翻。洛弗尔预计将于 2027 年 2 月再度接受犹他州韦伯县(Weber County)法院的量刑听证,而这一次,检方打算引入一项前所未有的元素:基于受害者真实录音与证词转录生成的 AI 语音克隆。

AI 语音克隆如何被制造

检方使用的是语音 AI 公司 ElevenLabs 的工具。办案人员将约斯特早年预备听证中留下的音频片段与对应文字转录一并输入,由 ElevenLabs 合成出「她本人」的朗读音频。传统上,法院遇到既往证人无法出庭时,通常安排真人代理当庭朗读证词;而使用 AI 语音克隆来呈现凶案受害者的既往宣誓证词,在美国潜在死刑案件中尚无先例。

辩方两位 AI 学者出庭作证

辩方团队邀请了两位学术界证人,从人机交互与机器学习两个角度提出反对意见。

第一位是犹他大学计算机系副教授、拥有加州大学欧文分校计算机科学博士学位的萨米尔·帕蒂尔(Sameer Patil)。他梳理了人机交互领域的研究,指出公众倾向于把 AI 生成内容当作真人产出对待:

  • 即便明知 ChatGPT 是 AI,用户仍会与之建立情感联结,甚至对其「发火」。
  • 一旦陪审团听到「约斯特的声音」,即便被事先告知这是合成音频,仍可能把内容当作真实陈述。

帕蒂尔强调,由于现有材料只有约斯特的文字证词,缺乏原始音频中的语调、节奏等副语言线索,无法验证 AI 输出与她本人实际陈述之间是否一致:「听起来像约斯特,并不等于内容准确,更不等于她说这些话时的真实语气。」

第二位证人是同样任教于犹他大学、前 Google DeepMind 研究科学家、卡内基梅隆大学机器学习博士肯尼斯·马里诺(Kenneth Marino)。他解释了语音合成工具的训练机制:

  • 通常用公开可得的播客、YouTube 视频等音频素材训练 TTS 模型。
  • 后续可用「权重」对输出做精细调节,但 ElevenLabs 并未公开其训练数据与权重参数。

马里诺直言:「我们其实完全不知道这个模型是用什么数据训练出来的。」辩方已就此向 ElevenLabs 发出传票,索取底层细节,截至发稿 ElevenLabs 尚未作出回应。

法庭进展与下一步

主审法官迈克尔·迪雷达(Michael DiReda)表示,预计将在 11 月中旬前后就是否允许播放 AI 语音克隆作出裁定。辩方同时已通知法庭,可能申请推迟原定 2027 年 2 月底开始的量刑程序,以便为裁定后的进一步法律行动预留时间。

这一争议让一桩横跨四十年的悬案站上了 AI 进入司法领域的风口浪尖。一旦获准,这将是美国首例在潜在死刑案件中以 AI 语音克隆呈现凶案受害者证词的庭审,相关裁定也将成为后续类似技术应用的参照。

信源