桃子桃子快讯
返回首页
研究论文

GuideSkill:把临床指南编译成可执行函数,提升 LLM 诊断推理

arXiv 新论文提出 GuideSkill,将临床实践指南编译为可执行打分函数,在四个基准、四款模型上一致提升诊断准确…

2026.07.30 · 周四3 分钟阅读

arXiv 上发表的一项研究提出名为 GuideSkill 的外部推理层,旨在让大语言模型(LLM)在临床诊断场景中更可靠地依据权威指南进行推理。与常见的「检索指南文本再让模型阅读」或「训练阶段吸收指南」的做法不同,GuideSkill 把疾病相关的诊断标准编译成可执行函数,输出有序的诊断支持分数(diagnostic-support scores),再与模型自身的判别排序融合。

方法概览:从指南到可执行技能

研究团队设计了两种构建方式:

  • GuideSkill-Zero:直接从临床实践指南(CPGs)初始化技能,覆盖指南中明确给出的诊断规则。
  • GuideSkill-Evo:在 Zero 基础上,利用病例—诊断配对数据对已覆盖技能进行精炼,并补齐缺失疾病。

推理阶段流程分三步:LLM 先生成候选鉴别诊断;然后为每个命中的技能「落地」所需临床特征;最后将 LLM 给出的排序与各技能执行得分进行融合,得到最终排序。整个机制不更新骨干模型参数,具有模型无关性。

实验结果:四项基准、四款骨干模型

研究在四个基准、四款不同骨干模型上进行了评测,主要结果包括:

  • GuideSkill-Zero 相较「指南 RAG」基线,宏平均准确率平均提升 13.45%。
  • GuideSkill-Evo 在每一款骨干模型上都取得最高宏平均准确率,相较直接推理相对提升 18.49%。
  • 技能覆盖率方面,标签级(gold-label)覆盖度从 56.5% 提升至 99.5%。
  • 在 Qwen3.5-9B 上,GuideSkill-Evo 不更新骨干模型参数,仍以 11.16% 的优势超过最强的「参数更新」基线。

研究还邀请临床专家对生成的技能进行评审,结果显示这些规则在临床上合理、可接受,说明从指南初始化和从病例演化得到的规则均具备可靠性与实用价值。

意义与定位

论文将 GuideSkill 定位为一种「模型无关」机制,用于把源自指南的流程性知识与源自病例的模式性诊断经验结合起来。在不修改大模型权重的前提下,通过外挂的可执行技能层即可获得稳定的诊断推理增益,这为临床 AI 系统的工程化部署提供了一条相对轻量的路径。

需要指出的是,文中提到的「Qwen3.5-9B」等模型命名与目前公开常见的通义千问系列版本号并不一致,读者在参考时应以其论文中的实验设置为准;同时该工作目前以 arXiv 预印本形式发布,尚未经过同行评审,结论仍需在更大范围基准与真实临床环境中进一步验证。

信源