发布于2026-07-23 阅读(0)
扫一扫,手机访问
先说几个核心判断:阿贡国家实验室团队这次搞出来的ChemGraph,确实有点东西。它的目标很明确——把计算化学中的分子模拟工作流,整个儿自动化起来。而驱动这一切的,是时下最火的大语言模型(LLM)。
这不是孤例。近年来,AI 特别是 LLM 的进步,让科学研究的自动化开始有了真正的想象力。行业内已经冒出了不少基于 LLM 的化学智能体:比如 ChemCrow,能搞定各种分子的化学合成;CACTUS,把化学信息学工具集成到一起,帮人做分子性质预测、相似性搜索、药物评估;还有 MDCrow,专门负责分子动力学(MD)工作流。你看,这个方向的热度,已经很明显了。
在这个大背景下,ChemGraph 的定位非常清晰:它就是一个由大语言模型驱动的智能体系统,专攻计算化学领域的分子模拟工作流。相关成果已经发表在 Nature 子刊 Communications Chemistry 上,标题是「ChemGraph as an agentic framework for computational chemistry workflows」。
研究亮点:

论文地址:https://www.nature.com/articles/s42004-025-01776-9
说句实话,计算化学领域一直缺一个统一的智能体评估基准。虽然有其他领域的基准测试框架,但这边几乎是空白。所以,研究团队自己动手,设计了13项基准实验,专门用来评估 ChemGraph 的能力。
这些实验的核心,就是测试 ChemGraph 利用六种集成工具完成任务的能力——包括单次工具调用,以及更复杂的工具链式调用。根据用户输入类型的不同,任务被分为三类:(1)分子名称;(2)SMILES 字符串;(3)化学反应。下面的表格汇总了这13项实验中进行的360次独立评估。

用于评估 ChemGraph 的基准实验汇总表
前11项实验,任务主要围绕分子名称或 SMILES 字符串展开,每项任务最多需要调用4次工具或完成4个子任务,属于“热身”级别。真正的硬骨头在最后两项——聚焦于化学反应热化学性质的计算。复杂程度直接拉满:根据反应物和生成物数量的不同,需要调用9到12次工具。具体来说,要对每种化学物质分别执行热化学计算,然后基于这些结果再构建反应层面的性质,层层嵌套。
由大语言模型驱动的智能体框架 ChemGraph
ChemGraph 的底层架构,基于 LangGraph 实现,并遵循 ReAct 框架。它的核心玩法是:通过结构化工具调用和推理能力,实现分子模拟工作流的自动化。
LangGraph 引入了一种基于图结构的执行模型,让多智能体协同更加稳健。一个典型的 LangGraph 工作流由三个核心部件组成:
下图展示了 ChemGraph 的通用结构:首先,大语言模型智能体获得一组预定义工具;根据用户提示词,它决定调用哪个工具;每次工具调用完成后,大语言模型会接收结果,并判断是否需要继续调用。当所有工具调用完成后,消息会沿两条路径之一继续传递。

ChemGraph 概览
第一种路径,ChemGraph 就像传统的大语言模型,返回一个类似人类语言的响应,里面包含工具调用的结果。第二种路径,消息会被转发给第二个大语言模型智能体,由它生成一个预定义的 JSON 结构化输出,直接响应用户请求。这种双模式设计,让 ChemGraph 既能支持自然语言交互,也能用于系统化评估,同时满足典型使用场景和评测工作流的需求。
下面的例子展示了 ChemGraph 如何调用工具并协调输出,完成一个具体的计算化学任务:

使用 GPT-4o-mini 执行 react2enthalpy 任务时,人类与 ChemGraph(单智能体)交互的示例
在这个例子里,用户要求 ChemGraph 用 GFN2-xTB 方法计算甲烷燃烧反应在400K条件下的反应焓。ChemGraph(搭载 GPT-4o-mini)先干了一件事:把反应中每个分子的化学名称转换成 SMILES 字符串(工具调用1至4)。然后,基于这些 SMILES 字符串,在 AtomsData 数据结构中生成原子坐标(工具调用5至8)。最后,用这些坐标和用户指定的参数(计算器类型、温度等)执行热力学计算。整个流程,干净利落。
通过13项基准任务,研究团队对 ChemGraph 在不同复杂程度计算化学任务中的表现进行了系统评估。结果呢?很有嚼头。
首先,针对三种大语言模型——GPT-4o-mini、Claude-3.5-haiku 和 Qwen-2.5-14B,评估了单智能体 ChemGraph 在13项实验任务中的表现;对于 GPT-4o,只评估了它在最后两个复杂任务(react2enthalpy 和 react2gibbs)中的表现。下图展示了不同模型在不同任务上的准确率。

单智能体 ChemGraph 的准确率热力图
几个有意思的发现:
然后,研究人员进一步用 GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14B 以及 GPT-4o 评估了多智能体 ChemGraph 的性能,并与单智能体结果进行了比较。

使用不同大语言模型时,多智能体和单智能体 ChemGraph 在 react2enthalpy 和 react2gibbs 任务中的平均准确率
结果非常明确:多智能体系统显著提升了不同模型的准确率。
具体来说,在 react2enthalpy 任务中,GPT-4o-mini 的准确率从40%飙升至87%,Claude-3.5-haiku 则从67%提升至87%(两者均为三次独立运行的平均值)。注意,这两个模型竟然都超过了单智能体 GPT-4o 的83%基准表现。在最后一个任务 react2gibbs 中,趋势类似:GPT-4o-mini 的准确率从49%提升至87%,Claude-3.5-haiku 则从69%提升至93%。相比之下,Qwen-2.5-14B 只获得了有限提升,主要原因在于它频繁出现工具调用错误,限制了聚合智能体生成准确答案的能力。
最终,在多智能体模式下,GPT-4o 实现了完美准确率,以100%的成功率完成了 react2enthalpy 和 react2gibbs 两个任务。
ChemGraph 作为面向计算化学和材料科学的大语言模型智能体系统,展现了 AI 自动化科研工作流的巨大潜力。研究团队表示,未来将通过集成更多工具、优化智能体架构以及增强高性能计算支持,进一步拓展 ChemGraph 在大规模模拟任务中的应用能力。同时,系统通过 Docker 容器保障运行安全,并持续提升智能体的可靠性。
需要强调的是,ChemGraph 的定位并非替代传统计算化学软件,而是通过自然语言交互,成为连接研究人员与模拟工具的智能协作层。随着开源大模型的发展,ChemGraph 也有望降低 AI 科研应用的成本,推动智能科学智能体在材料发现、分子设计等领域发挥更大价值。
参考文献:
https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html
https://www.nature.com/articles/s42004-025-01776-9
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9