桃子桃子快讯
返回首页
行业动态

小儿方用 15 万条专家思维链训练 AI 儿科医生

36 氪报道,小儿方联合北京儿童医院,以 15 万条专家思维链训练 AI 儿科系统,2000 例真实病例测试准确率达 8…

2026.08.24 · 周一4 分钟阅读

通用大模型直接进入儿科诊室,往往「水土不服」。36 氪报道,成立于 2018 年的小儿方健康科技联合国家儿童医学中心北京儿童医院,将一套基于专家思维链训练的 AI 儿科临床推理系统,送进了全国 30 余家医疗机构的诊室。在针对 2000 例北京儿童医院真实病例的对照测试中,这套系统诊断准确率达到 89%,五次独立一致率为 80%,均明显高于参与对照的 7 个通用大模型。

通用模型在儿科的短板

小儿方团队选取了当前表现最优的 7 个通用模型,让其扮演接诊医生,对 AI 模拟的标准病人进行问诊。结果显示,准确率最高的模型仅为 68.1%,远低于人类专家水平;五次独立一致率的最佳表现也只有 55.1%。

小儿方进一步拆解了错误来源:

  • 约三分之二的错误出在「不会想」,即模型缺乏专家级临床推理能力;
  • 约三分之一的错误出在「知识不够」,推理过程缺乏循证保障。

文章分析认为,大多数 AI 医疗产品本质上仍是检索和问答——输入症状,输出疾病列表。但临床诊断的本质并非匹配,而是推理:医生面对主诉,会迅速形成若干假设,通过追问、查体、检查逐一验证或排除,最终锁定答案。单纯的检索给不出这条推理链,而儿科又被称为「哑科」,患儿往往无法准确表达病情,对推理能力要求更高。

15 万条思维链:垂域系统的护城河

小儿方的技术路线基于全球医学教育公认的假设-演绎推理模型(Hypothetico-Deductive Reasoning),并搭建了三层核心资产:

  • 思维链数据:从 2023 年开始,联合北京儿童医院把专家看病的完整推理路径逐条拆解、记录、审核,包括先问什么、再查什么、优先排除哪些可能,已沉淀约 15 万条可训练数据;
  • 循证知识库:整合 300 余位北京儿童医院知名儿科专家的临床经验,结合约 3000 万份高质量病历、权威临床指南及最新科研成果,对诊断结论进行循证验证;
  • 评测管线:遵循真实诊疗逻辑,建立覆盖危险遗漏分级、分阶段预期诊断等精细标准的评测体系,精准衡量模型每一步医学推理的质量。

在此基础上,小儿方构建了「推理生成,循证验证」的双轮驱动架构:后训练让模型对齐专家推理思维,RAG 保证诊断有据可依,Agent 让 AI 像医生一样主动追问、逐层逼近,推理优化则确保在嘈杂诊室环境下响应稳定。

临床落地与两个真实案例

文章披露,截至 2026 年 8 月,AI 儿科医生已在北京、陕西、山西、黑龙江、河南、江苏等 12 个省市的 30 余家医疗机构落地,并以渭南市妇幼保健院为起点,向富平、合阳、白水等县域妇幼保健机构拓展。

报道引用了两个具代表性的病例:

  • AI 纠偏:渭南一名近 2 岁仍不会走路的孩子,曾被诊断为神经系统疾病,康复半年无效。AI 儿科医生根据现有检查资料重新判断,建议做基因筛查,最终确诊为与生长发育缓慢相关的疾病,术后孩子已能行走;
  • AI 拓界:一名出现呕吐和重度贫血的患儿,接诊医生起初考虑「营养性贫血」,AI 提示需警惕包括梅克尔憩室在内的先天性消化道异常,最终确诊。当地医生此后将该类病例纳入每周复盘。

产品形态上,这套系统已嵌入医生核心工作流,并荣获 2026 年度德国红点奖产品设计奖,文章称其为中国 AI 医疗硬件首次获此奖项。

基层推广与「一带一路」出海

政策层面,2025 年 11 月国家卫健委等五部门联合印发实施意见,明确到 2030 年基层诊疗智能辅助应用基本实现全覆盖,并聚焦儿科、精神、肿瘤及罕见病等重大疑难疾病的临床决策智能辅助。北京市随后发布行动计划,优先支持儿科等领域的 AI 技术发展。小儿方是「儿童医学大模型与健康医疗创新医疗应用」北京市重点实验室共建单位,也是北京国家级人工智能医疗健康应用中试基地的参与单位。

北京儿童医院院长倪鑫在采访中表示,小儿方与医院计划于 2026 年带 AI 儿科医生赴俄罗斯参展,并同步面向中亚五国等「一带一路」沿线国家推广。文章判断,从渭南县域起步到海外参展,小儿方正在跑通一条「技术验证—规模复制—海外输出」的 AI 医疗落地链路。

信源