商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

  发布于2026-07-23 阅读(0)

扫一扫,手机访问

先说几个核心判断:阿贡国家实验室团队这次搞出来的ChemGraph,确实有点东西。它的目标很明确——把计算化学中的分子模拟工作流,整个儿自动化起来。而驱动这一切的,是时下最火的大语言模型(LLM)。

这不是孤例。近年来,AI 特别是 LLM 的进步,让科学研究的自动化开始有了真正的想象力。行业内已经冒出了不少基于 LLM 的化学智能体:比如 ChemCrow,能搞定各种分子的化学合成;CACTUS,把化学信息学工具集成到一起,帮人做分子性质预测、相似性搜索、药物评估;还有 MDCrow,专门负责分子动力学(MD)工作流。你看,这个方向的热度,已经很明显了。

在这个大背景下,ChemGraph 的定位非常清晰:它就是一个由大语言模型驱动的智能体系统,专攻计算化学领域的分子模拟工作流。相关成果已经发表在 Nature 子刊 Communications Chemistry 上,标题是「ChemGraph as an agentic framework for computational chemistry workflows」。

研究亮点:

  • ChemGraph 的核心是图神经网络(GNN)基础模型,用来保证计算的准确和效率;同时它又借助 LLM 的推理、规划能力,给用户提供了一个堪称“自然语言交互”的直观界面。
  • 能干的活儿很全:从 SMILES 字符串和分子结构生成,到几何优化、振动分析、热化学计算,一条龙。
  • 支持多种分子模拟方法:半经验方法、机器学习势函数,甚至密度泛函理论(DFT)都行。

论文地址:https://www.nature.com/articles/s42004-025-01776-9

13项基准实验,建立计算化学智能体评估体系

说句实话,计算化学领域一直缺一个统一的智能体评估基准。虽然有其他领域的基准测试框架,但这边几乎是空白。所以,研究团队自己动手,设计了13项基准实验,专门用来评估 ChemGraph 的能力。

这些实验的核心,就是测试 ChemGraph 利用六种集成工具完成任务的能力——包括单次工具调用,以及更复杂的工具链式调用。根据用户输入类型的不同,任务被分为三类:(1)分子名称;(2)SMILES 字符串;(3)化学反应。下面的表格汇总了这13项实验中进行的360次独立评估。

用于评估 ChemGraph 的基准实验汇总表

前11项实验,任务主要围绕分子名称或 SMILES 字符串展开,每项任务最多需要调用4次工具或完成4个子任务,属于“热身”级别。真正的硬骨头在最后两项——聚焦于化学反应热化学性质的计算。复杂程度直接拉满:根据反应物和生成物数量的不同,需要调用9到12次工具。具体来说,要对每种化学物质分别执行热化学计算,然后基于这些结果再构建反应层面的性质,层层嵌套。

由大语言模型驱动的智能体框架 ChemGraph

ChemGraph 的底层架构,基于 LangGraph 实现,并遵循 ReAct 框架。它的核心玩法是:通过结构化工具调用和推理能力,实现分子模拟工作流的自动化。

LangGraph 引入了一种基于图结构的执行模型,让多智能体协同更加稳健。一个典型的 LangGraph 工作流由三个核心部件组成:

  • 状态(state):一个共享的数据结构,记录系统的当前状态。
  • 节点(nodes):定义智能体逻辑的 Python 函数。输入当前状态,输出更新后的状态。节点可以是大语言模型本身,也可以是执行特定操作的函数。
  • 边(edges):控制消息流向的函数,决定下一步执行哪个节点。有向边是固定单向传递,条件边则更灵活,可以根据特定条件让消息流向不同节点。

下图展示了 ChemGraph 的通用结构:首先,大语言模型智能体获得一组预定义工具;根据用户提示词,它决定调用哪个工具;每次工具调用完成后,大语言模型会接收结果,并判断是否需要继续调用。当所有工具调用完成后,消息会沿两条路径之一继续传递。

ChemGraph 概览

第一种路径,ChemGraph 就像传统的大语言模型,返回一个类似人类语言的响应,里面包含工具调用的结果。第二种路径,消息会被转发给第二个大语言模型智能体,由它生成一个预定义的 JSON 结构化输出,直接响应用户请求。这种双模式设计,让 ChemGraph 既能支持自然语言交互,也能用于系统化评估,同时满足典型使用场景和评测工作流的需求。

下面的例子展示了 ChemGraph 如何调用工具并协调输出,完成一个具体的计算化学任务:

使用 GPT-4o-mini 执行 react2enthalpy 任务时,人类与 ChemGraph(单智能体)交互的示例

在这个例子里,用户要求 ChemGraph 用 GFN2-xTB 方法计算甲烷燃烧反应在400K条件下的反应焓。ChemGraph(搭载 GPT-4o-mini)先干了一件事:把反应中每个分子的化学名称转换成 SMILES 字符串(工具调用1至4)。然后,基于这些 SMILES 字符串,在 AtomsData 数据结构中生成原子坐标(工具调用5至8)。最后,用这些坐标和用户指定的参数(计算器类型、温度等)执行热力学计算。整个流程,干净利落。

多智能体架构能显著提升模型表现

通过13项基准任务,研究团队对 ChemGraph 在不同复杂程度计算化学任务中的表现进行了系统评估。结果呢?很有嚼头。

单智能体评估

首先,针对三种大语言模型——GPT-4o-mini、Claude-3.5-haiku 和 Qwen-2.5-14B,评估了单智能体 ChemGraph 在13项实验任务中的表现;对于 GPT-4o,只评估了它在最后两个复杂任务(react2enthalpy 和 react2gibbs)中的表现。下图展示了不同模型在不同任务上的准确率。

单智能体 ChemGraph 的准确率热力图

几个有意思的发现:

  • name2smi 任务:Claude-3.5-haiku 有点“不听话”,没有始终调用 molecule_name_to_smiles 工具,有时会尝试用内部化学知识手动构建 SMILES 字符串,或者干脆拒绝使用工具。结果就是,它在这一任务中每个分子的平均工具调用次数是最低的。GPT-4o-mini 则很稳,准确完成任务。Qwen-2.5-14B 通常能生成准确的工具调用(包括正确的工具名称和参数),但它的错误主要发生在从工具输出中提取结果这个环节。
  • name2xyz、name2opt 和 name2vib 任务:这些任务要求模型不仅能准确调用工具,还要生成正确且结构化的输出结果。GPT-4o-mini 和 Claude-3.5-haiku 都表现不错,准确率超过83%。
  • smi2xyz 至 smi2file 任务:Claude-3.5-haiku 和 GPT-4o-mini 保持了稳定表现,准确率均超过83%。Qwen-2.5-14B 在这一组任务中也有所提升,最低准确率达到了77%。
  • react2enthalpy 和 react2gibbs 任务:这才是真正的分水岭。Qwen-2.5-14B 表现最弱,准确率低于20%。GPT-4o-mini 取得了中等水平,准确率分别为40%和49%。Claude-3.5-haiku 表现优于其他小规模模型,准确率分别达到67%和69%。而 GPT-4o 则直接拿下了最高性能,两个任务的平均准确率均超过83%。

多智能体评估

然后,研究人员进一步用 GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14B 以及 GPT-4o 评估了多智能体 ChemGraph 的性能,并与单智能体结果进行了比较。

使用不同大语言模型时,多智能体和单智能体 ChemGraph 在 react2enthalpy 和 react2gibbs 任务中的平均准确率

结果非常明确:多智能体系统显著提升了不同模型的准确率。

具体来说,在 react2enthalpy 任务中,GPT-4o-mini 的准确率从40%飙升至87%,Claude-3.5-haiku 则从67%提升至87%(两者均为三次独立运行的平均值)。注意,这两个模型竟然都超过了单智能体 GPT-4o 的83%基准表现。在最后一个任务 react2gibbs 中,趋势类似:GPT-4o-mini 的准确率从49%提升至87%,Claude-3.5-haiku 则从69%提升至93%。相比之下,Qwen-2.5-14B 只获得了有限提升,主要原因在于它频繁出现工具调用错误,限制了聚合智能体生成准确答案的能力。

最终,在多智能体模式下,GPT-4o 实现了完美准确率,以100%的成功率完成了 react2enthalpy 和 react2gibbs 两个任务。

写在最后

ChemGraph 作为面向计算化学和材料科学的大语言模型智能体系统,展现了 AI 自动化科研工作流的巨大潜力。研究团队表示,未来将通过集成更多工具、优化智能体架构以及增强高性能计算支持,进一步拓展 ChemGraph 在大规模模拟任务中的应用能力。同时,系统通过 Docker 容器保障运行安全,并持续提升智能体的可靠性。

需要强调的是,ChemGraph 的定位并非替代传统计算化学软件,而是通过自然语言交互,成为连接研究人员与模拟工具的智能协作层。随着开源大模型的发展,ChemGraph 也有望降低 AI 科研应用的成本,推动智能科学智能体在材料发现、分子设计等领域发挥更大价值。

参考文献:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9

本文转载于:https://36kr.com/p/3907913958413704 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注