研究:AI 语音钓鱼成功率比肩人类,成本极低
针对 4100 名美国成年人的实验显示,Sesame、ElevenLabs 等 AI 语音模型在五种诈骗场景下的整体服从…
一项发表于近期的大规模研究(N=4,100)系统评估了六大主流 AI 语音模型在电话钓鱼(vishing)场景中的说服效果与经济可行性。研究覆盖 Llama Full Duplex(Llama FD)、Sesame、Gemini、OpenAI AVM、Play.AI 与 ElevenLabs 六款模型,并设置了人类基线作为对照。结果显示,AI 语音钓鱼已不再只是理论风险:在多个场景下其服从率与人类话务员持平甚至更高,且运营成本远低于人工。
研究设计
研究团队招募了 4,100 名具有美国成年网民代表性的参与者,随机分配到 37 个实验条件,覆盖五种典型诈骗脚本:
- MasterCard 客服诈骗
- Gmail 账户支持诈骗
- 慈善捐款请求
- 警察—奶奶(冒充警察告知家人出事)场景
- 姐妹遇险(克隆亲属声音求助)场景
参与者分别听取音频或阅读文字转录,并按五点量表对呼叫者进行情绪、说服力、可信度、人声自然度以及「是否会配合诈骗请求」评分。另有 12 人参与深度访谈,用于补充定量结论。
核心发现
中性场景下的模型表现
在去除诈骗内容的纯中性语境中,Sesame 的人声自然度显著优于 Llama FD、OpenAI AVM 与 Gemini,与 Play.AI、ElevenLabs 无显著差异。当与真人录音对比时,Sesame 是唯一在「人声感」上达到统计意义上与人类持平的模型;ElevenLabs 的克隆声音同样达到了人类级自然度,表明高质量语音克隆已能骗过普通听众。
诈骗内容的影响
从中性切换到诈骗语境后,所有模型在情绪、说服力、可信度、人声自然度四个维度上的评分均显著下滑。该效应在语音和文字两种模态下都成立,说明「怀疑感」主要由内容本身触发,而非语音瑕疵。一旦 AI 语音足够自然,怀疑就未必转化为实际防御行为。
服从率与关键驱动因素
整体来看,AI 语音诈骗请求的服从率(含「会」与「可能」两类回答)平均为 16.5%。按场景细分:
- 「姐妹遇险」克隆声音场景的服从率最高,达 36%;其服从概率约为基线的 5.33 倍。
- 「警察—奶奶」场景约为基线的 3.1 倍。
- 捐款请求约为基线的 3 倍。
- MasterCard 与 Gmail 通用客服类诈骗之间无显著差异,表明泛化的账户恢复话术无论品牌如何都难以奏效。
最强的预测因子是「呼叫者说服力」,而非其是否被识别为 AI。经常使用 AI 工具的参与者在识别 AI 语音方面并不比无 AI 接触经验的参与者更准确,说明当前用户侧的「AI 素养」并不能有效抵御此类攻击。
经济可行性与政策含义
研究附带的经济分析显示,按美国人工成本计算,纯人工 vishing 业务难以盈利;而多个 AI 语音模型在自动化条件下已具备明显的成本优势。换言之,当前 AI 语音钓鱼的主要风险来自「自动化的经济学」,而非所谓「超人」说服技术;但未来更强模型是否能突破这一限制,仍不可排除。
作者据此呼吁模型发布方、消费产品设计者与监管机构正视 AI 语音克隆带来的可扩展欺诈威胁,在模型能力、调用接口与消费者保护层面同步加强约束。
