GxP-Agent:用流程 DAG 拓扑提升临床试验编程可靠性
研究者提出基于有向无环图的多智能体系统 GxP-Agent,在 CDISC 临床试验编程基准上以 Claude Sonn…
临床试验编程——即按照 CDISC 标准将研究方案转换为可用于统计分析的数据集——长期是监管递交流程中的瓶颈环节。然而现有基于大模型的代码生成方案在该任务上表现并不理想:研究者在 11 次单次生成尝试中测试了 5 个前沿模型,没有任何一次成功产出合规的受试者级分析数据集。
研究背景与问题
临床试验数据需遵循 CDISC 等监管标准,对变量命名、结构与追溯性都有严格要求。任务流程高度结构化,包含多个相互依赖的步骤,传统思路是让 LLM 一次性端到端生成数据集代码。但实证结果显示,无论是 OpenAI GPT-4.1、Anthropic Claude Sonnet 4.6,还是其他被测的前沿模型,在不做任何流程拆解的情况下,独立尝试全部失败,结构匹配率均为 0%。
GxP-Agent 方法
针对这一问题,作者提出 GxP-Agent,把监管流程的天然顺序编码为一张有向无环图(DAG),把原本单体的一次性数据集生成分解为 15 个领域专属节点,由具备 pharmaverse 技能上下文的 worker 智能体逐节点执行,并在节点之间设置验证门控与有条件的重试机制。核心思想是:与其完全依赖 LLM 的推理能力,不如把领域流程知识显式编码进图拓扑结构中。
基准与实验结果
研究者同步发布了 CDISC-Bench,基于 FDA 试点递交项目 CDISCPilot01 构建,包含 254 名受试者与 49 个真实 ADSL 变量。
- GxP-Agent 配合 Claude Sonnet 4.6 在三次独立运行中均达到 100% 结构匹配(49/49 变量、254 条记录全部正确)。
- 最佳检索增强基线仅 59.2%;所有单智能体与扁平多智能体方案均为 0%。
- DAG 结构还能显著拉强弱模型表现——GPT-4.1 在同一 DAG 下平均达到 59.2%,而其他架构下同样为 0%。
- 方法可泛化到 ADAE(不良事件)场景,使用 9 节点分支 DAG、55 个变量与 1,191 条记录,首次尝试即取得 100% 结构匹配。
意义与展望
这项工作的核心结论是:在 GxP 合规的临床试验编程任务中,把领域流程知识编码为图拓扑,比单纯依赖大模型推理更能产出可靠结果。它也为类似高合规、强流程、强结构化的行业任务提供了一条可复用的思路——用工程化骨架约束大模型的自由度,用验证门控保证每一步输出可追溯。
