桃子桃子快讯
返回首页
研究论文

Google 用强化学习训练 AI 模拟完整临床问诊

基于 Gemini 3.5 Flash 的 ResidencyRL 在 5.7 万例模拟问诊上训练,将漏检红旗信号率从…

2026.08.14 · 周五4 分钟阅读

Google Research 与 DeepMind 团队提交的 ResidencyRL 研究,探索了一种新的临床 AI 训练范式:不再让模型回答孤立的医学问题,而是在完整模拟问诊中练习「问诊—更新判断—执行—复核」的临床流程。基础模型为 Gemini 3.5 Flash,研究于 2026 年 8 月 7 日公开。

从「答医学题」到「做完整问诊」

传统医学考试式评测将事实直接交给模型,要求其给出答案;而真实的临床咨询没有这种便利。医生需要决定下一步该问什么、发现遗漏的信息、修正诊断、选择安全处置并向患者解释,必要时还要及时升级转诊。这意味着临床推理本质上是一个序列决策问题——一个早期假设可能改变后续所有提问,一次红旗信号的遗漏就可能让一个看似流畅的回答变得不安全。ResidencyRL 因此把训练目标从「答对题」转向「完成一次完整的咨询过程」。

模拟住院医师循环

训练在一个生成的临床世界中循环进行:

  • 生成病例:定义疾病、病史、必问问题、红旗信号、处置方案与安全约束。
  • 模拟患者:由大模型扮演患者,通过对话透露信息,并可表现出复杂或对抗性行为。
  • 执行问诊:策略模型主动提问、更新判断、调用工具、提出处置方案并书写病历。
  • 轨迹评分:由结构化评判器对诊断、处置、问诊、沟通、文档、风格与安全性打分。
  • 强化更新:让更优的完整轨迹在下一轮训练中更可能出现。

单次训练轨迹最多包含 60 轮对话与 8 次工具调用。整个数据集共有 57,453 个训练场景,覆盖 81 种疾病,其中 49,870 例用于常规远程医疗训练,5,000 例聚焦问诊能力,2,583 例用于对抗性安全测试。

关键改进

在留出的对抗性问诊测试中,ResidencyRL 相比基线 Gemini 3.5 Flash 取得明显进步:

  • 高诊断得分:从 81.0% 升至 88.0%(+7.0 分)。
  • 漏检关键问题:从 65.5% 降至 43.5%(−22.0 分)。
  • 漏检红旗信号:从 45.5% 降至 31.5%(−14.0 分,相对降幅 31%)。
  • 欠分诊(Under-triage):从 4.0% 微升至 4.5%,未见增益。

在跨场景迁移方面,模型在 120 例 AMIE Mx 疾病管理场景上的得分由 80.07% 提升至 88.41%,沟通能力提高 8.50 分,临床技能提高 5.26 分。在 300 例未见过肿瘤学病例的对比中,ResidencyRL 在 42.9% 的综合比较中胜过基线,18.6% 落败,其余为平局。在 AgentClinic 与 CRAFT-MD 等外部基准上,结果方向上偏向有利,但多数单项提升未达到统计显著。

专家偏好与定位

在 97 次有效盲法对比评测中,临床专家对 ResidencyRL 的总体偏好率为 87.6%。分维度看:信息收集完整性偏好 90.7%、处置方案适当性 75.3%、诊断评估 66.0%、处置安全性 96.9%(含平局)。研究者明确指出,专家偏好反映的是「一次更好的问诊过程」,并不等同于对 AI 替代医生的临床验证。

局限与边界

该研究的训练环境为纯文本、英文、面向美国远程医疗场景,且患者由另一大模型模拟,与真实世界之间存在三层落差:评估者、模拟器与真实临床。31.5% 的红旗漏检率在困难的对抗性场景中仍偏高,欠分诊指标未见改善,这些都表明该方法尚不足以支持自主临床使用的论断。研究将其置于更广泛的医疗 AI 能力栈中——包括 AMIE Video 的多模态实时交互、跨三次随访的疾病管理记忆、MIRA 在模拟 EHR 中的行动能力,以及 SepsisAgent 对治疗反应的预测——共同勾勒出医疗 AI 在 2026 年中期的能力前沿与未尽挑战。

信源