研究论文
CareGraph:面向个性化健康情报的可审计混合 AI 框架
arXiv 提出 CareGraph 框架,整合异构健康数据为可追溯趋势与解释,不做诊断;holdout 上趋势规则准确…
2026.08.31 · 周一约 3 分钟阅读
CareGraph 是一个面向个性化健康情报的可审计混合 AI 框架,由研究者在 arXiv 上提出。该框架将分散的临床记录、自我报告与可穿戴设备数据,整合为可追溯的优先趋势、缺失上下文指示、有边界的下一步建议、讨论问题以及带溯源链接的解释。
需要明确的是,CareGraph 只组织证据,不做诊断、不预测结局、不选择治疗方案,也不进行自主临床决策。
框架与处理流程
CareGraph 的处理流程覆盖七个环节:
- 确定性分析(deterministic analysis)
- 上下文检测(context detection)
- 图结构构建(graph construction)
- 受约束的语言模型合成(constrained language model synthesis)
- 证据验证(evidence validation)
- 安全控制(safety controls)
- 发布门控(release gating)
通过图结构组织证据,CareGraph 在生成解释时能够附带溯源链接,便于审计与回溯。
实验设置与基准表现
研究使用合成队列进行开发、验证与 holdout 测试,每组各 400 名患者。在 holdout 数据上:
- 冻结的普通最小二乘趋势规则配合充分性门控(sufficiency gate)达到 0.827 准确率、0.837 宏 F1(95% 置信区间 0.819–0.854)、0.974 的「数据不足」F1。
- 缺失上下文检测在新方案下达到 0.815 严格微 F1,而旧版检测器仅为 0.318。
- 作者构建的 holdout 基准上,安全规则集 v1.2 达到 1.000 精确率、0.950 召回率、0.974 F1。
与单体大模型对比
在 56 名匹配患者上,CareGraph 与单体 GPT 5.6 的对比结果:
- 响应速度:CareGraph 40.15 秒 vs. GPT 5.6 49.62 秒
- 输出长度:661 词 vs. 1,163 词
- 探索性词汇与纵向目标的对齐:CareGraph 更优
- 基线使用更少 token,引用更多原始证据
审计与局限
在 80 名患者的图检索审计中,CareGraph 生成 79 条合成与 78 条展示,未触发回退;1 条输出被拦截,1 条因证据键无效而失败关闭(fail-closed)。图结构对生成质量的增量影响仍需配对评估。
研究者表示,CareGraph 为智能化个性化健康系统提供了一个安全有界(safety-bounded)的基础。
