GraphDx:兼顾成本与准确率的多智能体临床诊断框架
arXiv 新论文提出 GraphDx,构建医学诊断知识图谱并配合三个协作智能体,在 MedQA 与 MIMIC-IV…
arXiv 上发表的一项新研究提出 GraphDx,一个面向序列诊断任务的知识增强多智能体框架。该工作针对现有 LLM 医学方案中存在的「知识–推理鸿沟」——即模型虽编码了丰富的医学知识,却难以在成本约束下系统化推理、往往过度检查的问题,引入了两个核心创新。
核心方法:MDKG 与三智能体协作
GraphDx 的第一项贡献是一条自动化流水线,利用 LLM 构建「医学诊断知识图谱(Medical Diagnosis Knowledge Graphs, MDKG)」,其特点包括:
- 量化典型性:为知识图谱中的节点赋予典型性分值,衡量症状、检查与疾病之间的代表程度。
- 以动作为中心的拓扑结构:图谱以可执行的临床动作(如问诊、检查)为核心组织,而非单纯的知识关联。
- 双目标属性:每个动作同时带有「诊断相关性」与「成本敏感性」两类属性,便于在推理时做权衡。
第二项贡献是一个由三个协作智能体组成的系统:
- 感知智能体(Perception Agent):负责自然语言理解与生成,处理医患对话或病历文本。
- 决策智能体(Decision Agent):将推理结果转回自然语言,向用户输出后续行动建议。
- 推理智能体(Reasoning Agent):在 MDKG 上执行确定性的证据打分与「成本感知」规划,是整个框架的计算核心。
推理智能体以图谱结构而非纯语言推理为基础,避免了 LLM 在长链决策中可能出现的发散与「检查过度」问题。
实验设置与结果
研究在两个常用基准上评估了 GraphDx:
- MedQA:医学问答数据集,覆盖常见临床选择题。
- MIMIC-IV:大型重症监护电子病历数据集,包含真实临床场景。
实验横跨三种 LLM 基座:DeepSeek-V3、Kimi-k2 与 Llama-3.3。结果显示:
- 诊断成功率:在不引入 GraphDx 时,三种基座仅能达到 50–68%;加入框架后,成功率提升至 79–93%。
- 测试成本:同时下降 20–54%,意味着在提高准确性的前提下,模型主动减少了冗余检查与提问。
此外,得益于推理智能体在显式图谱上的确定性计算,GraphDx 的决策过程更易追溯,相比纯 prompt 的 LLM 方案具备更好的可解释性,对临床应用的可靠性有所助益。
意义与局限
GraphDx 把「知识图谱 + 多智能体 + 成本约束」三者结合起来,为 LLM 进入真实临床工作流提供了一条相对务实的路径。它表明:在医疗这种高风险、资源敏感的领域,单纯依赖模型规模的扩展并不足以解决过度检查与可解释性问题;引入结构化知识与确定性规划,是当前更可行的工程化路线。
需要注意的是,该论文为 arXiv 预印本,尚未经过同行评审;实验覆盖的 LLM 基座也以近期开源或开放权重模型为主,未与闭源前沿模型(如 GPT、Claude、Gemini 系列)做直接对比,因此结果的外推性仍待更多独立验证。
