面向去标识化任务的大模型基准数据集发布
一项新的 LLM 基准数据集发布,专注于评估大模型在邮件文本去标识化和合成生成任务上的表现。
一项名为「LLM Benchmark for de-identification and synthesis」的基准数据集近期在 Hacker News 上引发关注。该数据集聚焦于评估大语言模型在文本去标识化(de-identification)与合成生成(synthesis)两项任务上的能力,旨在为医疗、合规、企业通信等强隐私敏感场景下的 LLM 应用提供量化评测依据。
数据集结构与规模
数据集采用典型的 JSON 格式组织,每条记录附带唯一 row_id 与 sha256 校验值,便于在评测流水线中精确追踪样本。整体包含约 1.84 万行真实邮件文本,每条邮件的文本长度中位数为 42.2k 字符,并配套提供 ground_truth_spans 标注列表,单条样本标注数最多可达 508 项。文件层面以 .eml 原始格式留存,确保去标识化任务面对的是真实而非人工生成的邮件结构。
标注体系
标注采用实体跨度(span)形式,给出每个敏感字段在原文中出现的位置、起止偏移、字符内容以及类别标签。可见的类别至少包括:
- NAME_GIVEN:姓名中的名,例如 Aaron、Beth、Dave、Chris;
- ORGANIZATION:组织机构,例如 Dana-Farber;
- 同时还会附带邮箱地址、邮件头中的 from/to 字段等结构化元数据。
值得注意的是,部分标注还记录了「原始形式」与「文中出现形式」之间的差异,例如文中出现 Aaron,对应原始邮箱用户名为 michael.osei@pfizer.com 等情况。这意味着评测任务不仅要求模型识别敏感字段,还要正确处理拼写变体、昵称以及中英文混用等真实场景。
典型任务样例
以一封 Pfizer 内部邮件为例:发件人 Michael Osei 通知 Aaron Goldberg,Seagen 整合后加入的领导 Beth Cole 将开启跨区域巡访,邮件中包含人物姓名、组织名、职位关系等多层敏感信息,测试模型能否在保留语义的前提下抹除这些字段。另一例则涉及 Dana-Farber 的 340B 合作协议签署,邮件中出现 Bill Ostrowski、Rebecca Stein 等多名医生与机构名,并附带文档确认、合同执行等业务上下文,对模型在长文本中维持去标识化一致性的能力提出挑战。
潜在价值与局限
该基准对医药代表邮件、临床沟通、合规审计等场景下的 LLM 应用具有参考价值,可用于对比不同模型在敏感信息抽取与伪文本合成上的差异。不过,目前公开内容仅展示了数据集结构与若干样本,尚无配套的排行榜、评测脚本或官方论文链接,读者若想系统使用,还需进一步查阅项目仓库以获取完整评测协议和基线结果。
