桃子桃子快讯
返回首页
研究论文

CareGraph:面向个性化健康情报的可审计混合 AI 框架

arXiv 提出 CareGraph 框架,整合异构健康数据为可追溯趋势与解释,不做诊断;holdout 上趋势规则准确…

2026.08.31 · 周一3 分钟阅读

CareGraph 是一个面向个性化健康情报的可审计混合 AI 框架,由研究者在 arXiv 上提出。该框架将分散的临床记录、自我报告与可穿戴设备数据,整合为可追溯的优先趋势、缺失上下文指示、有边界的下一步建议、讨论问题以及带溯源链接的解释。

需要明确的是,CareGraph 只组织证据,不做诊断、不预测结局、不选择治疗方案,也不进行自主临床决策。

框架与处理流程

CareGraph 的处理流程覆盖七个环节:

  • 确定性分析(deterministic analysis)
  • 上下文检测(context detection)
  • 图结构构建(graph construction)
  • 受约束的语言模型合成(constrained language model synthesis)
  • 证据验证(evidence validation)
  • 安全控制(safety controls)
  • 发布门控(release gating)

通过图结构组织证据,CareGraph 在生成解释时能够附带溯源链接,便于审计与回溯。

实验设置与基准表现

研究使用合成队列进行开发、验证与 holdout 测试,每组各 400 名患者。在 holdout 数据上:

  • 冻结的普通最小二乘趋势规则配合充分性门控(sufficiency gate)达到 0.827 准确率、0.837 宏 F1(95% 置信区间 0.819–0.854)、0.974 的「数据不足」F1。
  • 缺失上下文检测在新方案下达到 0.815 严格微 F1,而旧版检测器仅为 0.318。
  • 作者构建的 holdout 基准上,安全规则集 v1.2 达到 1.000 精确率、0.950 召回率、0.974 F1。

与单体大模型对比

在 56 名匹配患者上,CareGraph 与单体 GPT 5.6 的对比结果:

  • 响应速度:CareGraph 40.15 秒 vs. GPT 5.6 49.62 秒
  • 输出长度:661 词 vs. 1,163 词
  • 探索性词汇与纵向目标的对齐:CareGraph 更优
  • 基线使用更少 token,引用更多原始证据

审计与局限

在 80 名患者的图检索审计中,CareGraph 生成 79 条合成与 78 条展示,未触发回退;1 条输出被拦截,1 条因证据键无效而失败关闭(fail-closed)。图结构对生成质量的增量影响仍需配对评估。

研究者表示,CareGraph 为智能化个性化健康系统提供了一个安全有界(safety-bounded)的基础。

信源