LLM自传生成审计研究:96.7%场景未能通过事实核查
arXiv论文对LLM以对话方式生成的366篇自传逐日审计,发现96.7%的内容无法被独立记录核实,仅12天含可核实场景…
近期发表于 arXiv 的一项研究对大语言模型(LLM)生成的自传体内容进行了场景级事实核查审计。研究以一位真实作者本人为对象,由其与一个对话式 LLM 协作完成一本 366 天的「每日一页」自传手稿,随后用预先确定的四级评分量表,对每一天的每个轶闻场景逐一比对独立验证语料。
核心发现:96.7% 的天数未能通过验证
审计将「核查失败率」定义为未被评定为「VERIFIED(场景得到正面佐证)」的天数占比。结果显示:
- 366 天中有 354 天未通过验证,占比 96.7%(Wilson 95% CI 94.4–98.1%)。
- 仅 12 天包含至少一个可被独立记录佐证的场景。
- 19 天(约 5.2%)的内容主张被记录直接反驳,属于「主动矛盾」类失败。
研究指出,最主要的失败模式是「grounded drift(锚定漂移)」——即场景中的人物、雇主、地点等元素为真实存在,但被嵌入到虚构情节中。
方法学贡献:可复用的审计工具
研究的另一项贡献是提出了一套场景级审计流程与四级分类体系(从「得到佐证」到「被反驳」)。独立重评复制了主要结论,未发现原始失败率被高估的证据。但同时显示,四级分类在评分者间的一致性仅达到「fair-to-moderate」水平,尤其是「WEAK」与「UNVERIFIED」之间的边界可靠性较差,提示该分类仍有改进空间。
锚定语料可改善但无法根除
为测试缓解方案,研究在保持相同输入的前提下,将生成过程锚定到主体本人已有的语料库。结果验证率显著提升,但仍留下 83.3% 的残余失败率,说明仅仅提供相关语料并不能彻底消除虚构问题。
研究还使用当前主流命名模型重新生成同一批天数,在相同输入条件下同样复现了 100% 的核查失败,表明该现象并非个别模型的偶发问题。
意义与局限
这是据作者所知首个针对「LLM 生成自传」对主体专属真值语料进行量化审计的工作,为评估长文本生成中的「confabulation(虚构)」提供了可复用的测量框架。然而,研究为单一主体的案例研究,结论的外部推广性仍需后续工作验证;同时评分量表的评分者一致性不足,也提示未来需要更精细的标注规范。
