桃子桃子快讯
返回首页
研究论文

阿贡实验室提出 ChemGraph:以多智能体架构自动化计算化学工作流

美国阿贡国家实验室在 Nature 子刊发表 ChemGraph,用 LLM 驱动智能体完成分子模拟全流程,13 项基准…

2026.07.23 · 周四4 分钟阅读

美国阿贡国家实验室的研究团队近日在 Nature 子刊 Communications Chemistry 发表论文,提出由大语言模型驱动的智能体框架 ChemGraph,用于自动化执行计算化学领域中的分子模拟工作流程。研究同时设计了 13 项基准任务、共 360 次独立评估,是目前计算化学领域首个面向智能体的统一评测体系。

研究背景与核心思路

近年来,已有多款 LLM 化学智能体被开发,例如专注化学合成的 ChemCrow、面向化学信息学的 CACTUS,以及可执行分子动力学工作流的 MDCrow。ChemGraph 的差异化在于:结合图神经网络基础模型完成高效计算,由 LLM 负责自然语言理解、任务规划与科学推理,提供直观的交互式界面。

系统支持半经验方法(如 GFN2-xTB)、机器学习势函数以及密度泛函理论(DFT)等多种分子模拟方法,可完成从 SMILES 字符串与分子结构生成,到几何优化、振动分析及热化学计算的完整链路。

框架实现:基于 LangGraph 的双模式设计

ChemGraph 基于 LangGraph 构建并遵循 ReAct 框架,包含三类要素:

  • 状态:表示系统当前状态的共享数据结构
  • 节点:定义智能体逻辑的 Python 函数,可为大模型或特定操作函数
  • 边:控制消息流向,可为有向边或条件边

执行时,LLM 智能体首先获得一组预定义工具,依据用户提示决定调用哪一个;每次调用完成后,LLM 接收结果并判断是否继续。消息可沿两条路径传递:一条返回类似人类的自然语言响应,另一条转发给第二个智能体以生成预定义 JSON 格式的结构化输出,从而兼顾交互与评测场景。

13 项基准与单智能体评估

研究人员将 13 项任务按输入类型分为三类:分子名称、SMILES 字符串、化学反应。前 11 项任务最多调用 4 次工具,最后 2 项聚焦热化学性质计算,需调用 9 至 12 次工具,复杂度显著提高。

在单智能体设置下评估了 GPT-4o-mini、Claude-3.5-haiku 与 Qwen-2.5-14B,并对 GPT-4o 仅评估最复杂的两个任务。关键发现:

  • 简单任务(name2smi、name2xyz、name2opt、name2vib):GPT-4o-mini 与 Claude-3.5-haiku 准确率均超过 83%
  • 中等任务(smi2xyz 至 smi2file):三者最低准确率仍有 77%
  • 复杂任务(react2enthalpy、react2gibbs):Qwen-2.5-14B 低于 20%,GPT-4o-mini 分别为 40% 和 49%,Claude-3.5-haiku 达到 67% 和 69%,GPT-4o 超过 83%

多智能体架构显著提升表现

在多智能体设置下评估了同一组模型,并与单智能体对比。复杂任务上的提升尤为明显:

  • react2enthalpy:GPT-4o-mini 从 40% 提升至 87%,Claude-3.5-haiku 从 67% 提升至 87%,均超过单智能体 GPT-4o 的 83% 基线
  • react2gibbs:GPT-4o-mini 从 49% 提升至 87%,Claude-3.5-haiku 从 69% 提升至 93%
  • GPT-4o 在多智能体模式下两个任务均达到 100% 准确率

Qwen-2.5-14B 提升有限,主要原因是工具调用错误频繁,限制了聚合智能体生成准确答案的能力。结果表明,将复杂任务拆解为更小、更易管理的子任务,可有效弥补小模型在长链路规划上的短板。

意义与未来方向

研究团队表示,ChemGraph 并非要替代传统计算化学软件,而是作为连接研究人员与模拟工具的智能协作层。后续工作将聚焦集成更多工具、优化智能体架构、加强高性能计算支持,并通过 Docker 容器保障运行安全。随着开源大模型发展,ChemGraph 有望降低 AI 科研应用成本,在材料发现、分子设计等场景释放更大价值。

论文地址:https://www.nature.com/articles/s42004-025-01776-9

信源