Nature Medicine 呼吁构建医学 AI 超智能评测框架
斯坦福等机构联合多家 AI 企业在 Nature Medicine 发文,指出当前基准不足以衡量医学 AI 超智能水平,…
医学人工智能在过去几年快速进入临床研究与真实诊疗场景,但如何衡量这些系统是否真正达到「超智能」水平,一直缺乏被广泛认可的评估工具。2026 年 7 月 27 日,《Nature Medicine》发表了一篇由斯坦福大学领衔、联合哈佛、MIT、OpenAI、Anthropic、Google、Microsoft 等多家机构与公司研究者共同署名的评论文章,题为「Toward a test of medical AI superintelligence」,呼吁建立一套任务驱动、严谨可比的医学 AI 评测框架。
文章核心主张
文章作者明确指出,现有的医学 AI 基准在评估「超智能」时存在误导性且不充分的问题。作者认为,仅仅在静态问答或选择题集合上取得高分,并不能反映模型在真实临床任务中的能力上限,更无法衡量模型是否真正超越了人类专家的整体表现。
因此,文章呼吁研究社区紧急推进一项严格的、以任务为基础的评测体系,覆盖诊断推理、治疗决策、罕见病识别、医患沟通等高难度临床场景,并保证评测可重复、可比较、可被外部独立验证。
作者阵容与多方协同
这篇评论的作者阵容体现了医学 AI 跨学科、跨产业的典型特征:
- 学术机构方面,由斯坦福大学计算医学部、哈佛医学院生物信息系、MIT、Oxford Internet Institute、加州大学旧金山分校等多所高校研究者参与。
- 产业方面,包括来自 Google、Microsoft、Amazon、Anthropic、OpenAI 的研究者,显示出主要 AI 实验室对医学 AI 安全评测的共同关注。
- 政策与医疗系统方面,ARPA-H(美国卫生高级研究计划局)的 David Gunning、Bon Ku、Haider Warraich 也参与了署名,反映出评测框架在政策落地层面的考量。
- 知名学者 Eric Topol(Scripps)、Eric Horvitz(Microsoft)、Robert Wachter(UCSF)等长期关注 AI 与医疗的研究者均在作者之列。
对行业与研究的影响
虽然该文为评论性文章、不提供具体实验数据,但它对医学 AI 评测领域具有风向标意义:
- 对研究者:明确了未来基准设计需要更贴近真实临床任务,强调任务复杂度和端到端评估,而非简单刷榜。
- 对监管方与医院:提供了与产业共识对齐的评测思路,有助于在部署前筛选真正具备临床价值的模型。
- 对 AI 厂商:促使 OpenAI、Anthropic、Google、Microsoft 等头部公司意识到医学领域需要统一、可比的评估标准,而非各自内部基准。
局限与可获取性
需要注意的是,该文目前在 Nature 平台上仅开放预览摘要,正文需通过机构订阅或在 SpringerLink 单篇购买(39.95 欧元)才能阅读全文。文章并未附带具体的基准代码或实验结果,因此其在评测方法上的具体技术细节尚待完整版本披露。读者若希望深入理解所提出的框架,建议关注作者团队后续在 arXiv、medRxiv 或相关期刊发表的配套研究论文。
总体而言,这篇评论代表了医学 AI 领域对「如何严肃评估超智能」这一问题的一次高层级共识表达,对后续基准建设和监管讨论具有重要参考价值。
