医学文本水印首次系统评测:5 种方案、18 个模型,水印或诱发幻觉与术语错误
arXiv 新论文首次系统评估大模型水印在医学文本上的影响,发现水印可能引发词元损坏、术语幻觉和图像发现遗漏等问题。
随着大语言模型(LLM)逐步嵌入临床工作流,如何追踪 AI 生成内容成为关键问题,水印技术因此被寄予厚望。但现有水印评测大多基于通用语料,在医学这类对语义极度敏感的场景中表现如何,仍缺乏系统研究。arXiv 上线的一篇论文《Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts》填补了这一空白,对当前主流水印方案在医学任务上的副作用进行了首次严格评测。
研究规模与覆盖范围
论文对 5 种水印方案 在 11 个 LLM 与 7 个视觉-语言模型(VLM) 上展开测评,覆盖单模态与多模态临床推理任务。为弥补既有评测依赖聚合指标的不足,作者还引入一条由人类医学专家参与的校验流程,对医学推理质量、术语精确度与诱发幻觉进行系统审计。
核心发现:水印可能放大临床风险
实验结果显示,水印并非「无损」叠加,它会在多个失效维度上造成显著退化,具体包括:
- 词元级损坏(lexical corruption):文本中出现非预期的字词改写;
- 术语幻觉(hallucinated terminology):捏造不存在的医学概念;
- 图像发现误归属或遗漏:在多模态任务中,水印干扰会放大对影像学发现的错配或漏报。
研究尤其指出,依赖聚合指标而不进行领域专项分析,会系统性掩盖水印带来的临床级失败。这意味着当前通用基准得出的「水印不影响输出质量」的结论,在医学语境下可能并不成立。
对部署的启示
论文结论强调,领域特定评测应成为医学场景中水印化模型安全部署的前置条件。作者认为,如果不在临床文本上做专门的失效模式审查,现行基准可能掩盖具有临床后果的错误,进而影响诊疗决策的可追溯性与可靠性。
研究意义与局限
作为首个在医学领域对水印进行端到端评测的工作,论文为后续研究提供了可复现的协议与人类专家校验流程。论文同时提醒行业:在追求模型可追溯性的同时,不能以临床安全性为代价;面向高风险领域的水印设计,需要与领域语义审计机制协同推进。论文目前以 arXiv 预印本形式发布(编号 2607.20462v1),尚需经过同行评议以确认其在更大模型与更多临床子任务上的稳定性。
