展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡实验室提出大语言模型驱动的智能体框架ChemGraph,专攻计算化学分子模拟工作流自动化。通过13项基准实验评估,多智能体架构显著提升复杂反应焓与吉布斯自由能计算准确率,GPT-4o实现100%成功率。

先说几个核心判断:阿贡国家实验室团队这次搞出来的ChemGraph,确实有点东西。它的目标很明确——把计算化学中的分子模拟工作流,整个儿自动化起来。而驱动这一切的,是时下最火的大语言模型(LLM)。

这不是孤例。近年来,AI 特别是 LLM 的进步,让科学研究的自动化开始有了真正的想象力。行业内已经冒出了不少基于 LLM 的化学智能体:比如 ChemCrow,能搞定各种分子的化学合成;CACTUS,把化学信息学工具集成到一起,帮人做分子性质预测、相似性搜索、药物评估;还有 MDCrow,专门负责分子动力学(MD)工作流。你看,这个方向的热度,已经很明显了。

在这个大背景下,ChemGraph 的定位非常清晰:它就是一个由大语言模型驱动的智能体系统,专攻计算化学领域的分子模拟工作流。相关成果已经发表在 Nature 子刊 Communications Chemistry 上,标题是「ChemGraph as an agentic framework for computational chemistry workflows」。

研究亮点:

  • ChemGraph 的核心是图神经网络(GNN)基础模型,用来保证计算的准确和效率;同时它又借助 LLM 的推理、规划能力,给用户提供了一个堪称“自然语言交互”的直观界面。
  • 能干的活儿很全:从 SMILES 字符串和分子结构生成,到几何优化、振动分析、热化学计算,一条龙。
  • 支持多种分子模拟方法:半经验方法、机器学习势函数,甚至密度泛函理论(DFT)都行。

论文地址:https://www.nature.com/articles/s42004-025-01776-9

13项基准实验,建立计算化学智能体评估体系

说句实话,计算化学领域一直缺一个统一的智能体评估基准。虽然有其他领域的基准测试框架,但这边几乎是空白。所以,研究团队自己动手,设计了13项基准实验,专门用来评估 ChemGraph 的能力。

这些实验的核心,就是测试 ChemGraph 利用六种集成工具完成任务的能力——包括单次工具调用,以及更复杂的工具链式调用。根据用户输入类型的不同,任务被分为三类:(1)分子名称;(2)SMILES 字符串;(3)化学反应。下面的表格汇总了这13项实验中进行的360次独立评估。

用于评估 ChemGraph 的基准实验汇总表

前11项实验,任务主要围绕分子名称或 SMILES 字符串展开,每项任务最多需要调用4次工具或完成4个子任务,属于“热身”级别。真正的硬骨头在最后两项——聚焦于化学反应热化学性质的计算。复杂程度直接拉满:根据反应物和生成物数量的不同,需要调用9到12次工具。具体来说,要对每种化学物质分别执行热化学计算,然后基于这些结果再构建反应层面的性质,层层嵌套。

由大语言模型驱动的智能体框架 ChemGraph

ChemGraph 的底层架构,基于 LangGraph 实现,并遵循 ReAct 框架。它的核心玩法是:通过结构化工具调用和推理能力,实现分子模拟工作流的自动化。

LangGraph 引入了一种基于图结构的执行模型,让多智能体协同更加稳健。一个典型的 LangGraph 工作流由三个核心部件组成:

  • 状态(state):一个共享的数据结构,记录系统的当前状态。
  • 节点(nodes):定义智能体逻辑的 Python 函数。输入当前状态,输出更新后的状态。节点可以是大语言模型本身,也可以是执行特定操作的函数。
  • 边(edges):控制消息流向的函数,决定下一步执行哪个节点。有向边是固定单向传递,条件边则更灵活,可以根据特定条件让消息流向不同节点。

下图展示了 ChemGraph 的通用结构:首先,大语言模型智能体获得一组预定义工具;根据用户提示词,它决定调用哪个工具;每次工具调用完成后,大语言模型会接收结果,并判断是否需要继续调用。当所有工具调用完成后,消息会沿两条路径之一继续传递。

ChemGraph 概览

第一种路径,ChemGraph 就像传统的大语言模型,返回一个类似人类语言的响应,里面包含工具调用的结果。第二种路径,消息会被转发给第二个大语言模型智能体,由它生成一个预定义的 JSON 结构化输出,直接响应用户请求。这种双模式设计,让 ChemGraph 既能支持自然语言交互,也能用于系统化评估,同时满足典型使用场景和评测工作流的需求。

下面的例子展示了 ChemGraph 如何调用工具并协调输出,完成一个具体的计算化学任务:

使用 GPT-4o-mini 执行 react2enthalpy 任务时,人类与 ChemGraph(单智能体)交互的示例

在这个例子里,用户要求 ChemGraph 用 GFN2-xTB 方法计算甲烷燃烧反应在400K条件下的反应焓。ChemGraph(搭载 GPT-4o-mini)先干了一件事:把反应中每个分子的化学名称转换成 SMILES 字符串(工具调用1至4)。然后,基于这些 SMILES 字符串,在 AtomsData 数据结构中生成原子坐标(工具调用5至8)。最后,用这些坐标和用户指定的参数(计算器类型、温度等)执行热力学计算。整个流程,干净利落。

多智能体架构能显著提升模型表现

通过13项基准任务,研究团队对 ChemGraph 在不同复杂程度计算化学任务中的表现进行了系统评估。结果呢?很有嚼头。

单智能体评估

首先,针对三种大语言模型——GPT-4o-mini、Claude-3.5-haiku 和 Qwen-2.5-14B,评估了单智能体 ChemGraph 在13项实验任务中的表现;对于 GPT-4o,只评估了它在最后两个复杂任务(react2enthalpy 和 react2gibbs)中的表现。下图展示了不同模型在不同任务上的准确率。

单智能体 ChemGraph 的准确率热力图

几个有意思的发现:

  • name2smi 任务:Claude-3.5-haiku 有点“不听话”,没有始终调用 molecule_name_to_smiles 工具,有时会尝试用内部化学知识手动构建 SMILES 字符串,或者干脆拒绝使用工具。结果就是,它在这一任务中每个分子的平均工具调用次数是最低的。GPT-4o-mini 则很稳,准确完成任务。Qwen-2.5-14B 通常能生成准确的工具调用(包括正确的工具名称和参数),但它的错误主要发生在从工具输出中提取结果这个环节。
  • name2xyz、name2opt 和 name2vib 任务:这些任务要求模型不仅能准确调用工具,还要生成正确且结构化的输出结果。GPT-4o-mini 和 Claude-3.5-haiku 都表现不错,准确率超过83%。
  • smi2xyz 至 smi2file 任务:Claude-3.5-haiku 和 GPT-4o-mini 保持了稳定表现,准确率均超过83%。Qwen-2.5-14B 在这一组任务中也有所提升,最低准确率达到了77%。
  • react2enthalpy 和 react2gibbs 任务:这才是真正的分水岭。Qwen-2.5-14B 表现最弱,准确率低于20%。GPT-4o-mini 取得了中等水平,准确率分别为40%和49%。Claude-3.5-haiku 表现优于其他小规模模型,准确率分别达到67%和69%。而 GPT-4o 则直接拿下了最高性能,两个任务的平均准确率均超过83%。

多智能体评估

然后,研究人员进一步用 GPT-4o-mini、Claude-3.5-haiku、Qwen-2.5-14B 以及 GPT-4o 评估了多智能体 ChemGraph 的性能,并与单智能体结果进行了比较。

使用不同大语言模型时,多智能体和单智能体 ChemGraph 在 react2enthalpy 和 react2gibbs 任务中的平均准确率

结果非常明确:多智能体系统显著提升了不同模型的准确率。

具体来说,在 react2enthalpy 任务中,GPT-4o-mini 的准确率从40%飙升至87%,Claude-3.5-haiku 则从67%提升至87%(两者均为三次独立运行的平均值)。注意,这两个模型竟然都超过了单智能体 GPT-4o 的83%基准表现。在最后一个任务 react2gibbs 中,趋势类似:GPT-4o-mini 的准确率从49%提升至87%,Claude-3.5-haiku 则从69%提升至93%。相比之下,Qwen-2.5-14B 只获得了有限提升,主要原因在于它频繁出现工具调用错误,限制了聚合智能体生成准确答案的能力。

最终,在多智能体模式下,GPT-4o 实现了完美准确率,以100%的成功率完成了 react2enthalpy 和 react2gibbs 两个任务。

写在最后

ChemGraph 作为面向计算化学和材料科学的大语言模型智能体系统,展现了 AI 自动化科研工作流的巨大潜力。研究团队表示,未来将通过集成更多工具、优化智能体架构以及增强高性能计算支持,进一步拓展 ChemGraph 在大规模模拟任务中的应用能力。同时,系统通过 Docker 容器保障运行安全,并持续提升智能体的可靠性。

需要强调的是,ChemGraph 的定位并非替代传统计算化学软件,而是通过自然语言交互,成为连接研究人员与模拟工具的智能协作层。随着开源大模型的发展,ChemGraph 也有望降低 AI 科研应用的成本,推动智能科学智能体在材料发现、分子设计等领域发挥更大价值。

参考文献:

https://phys.org/news/2026-07-ai-framework-battery-combustion-materials.html

https://www.nature.com/articles/s42004-025-01776-9

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。