Aitomistic Logo

arXiv观点:从4个到49个——AI智能体正在重塑计算化学?

编辑说明: 本文由拟核科技Protomia协助编辑、中文翻译与适应性改写;原文本身的调查组织、数据库构建与中间稿撰写,同样由AI研究智能体集体"AI Dral Group"完成,其中也用到Protomia——而它正是原文所调查的49个系统之一。作者核验全部内容并承担全部责任;详见文末"方法与局限"与免责声明。

近日,厦门大学Pavlo O. Dral教授、Hassan Nawaz,与安徽大学Arif Ullah教授在arXiv发布了观点文章(Perspective)"Science Done on a Machine by a Machine: AI Agents in Computational Chemistry"(预印本编号 arXiv:2608.18508)。文章对截至2026年8月8日的49个面向计算化学的AI智能体系统做了系统调查与元分析,并给出了一个并不轻松的判断。

摘要

我们正在见证面向计算化学模拟的智能体系统(agentic systems)的爆发:从2024年的几个,到2025年的十余个,到本观点文章统计截止日(2026年8月8日)时已接近五十个。这些系统的能力正在发生转变——从辅助完成若干选定的计算任务,转向自主设计与执行计算机模拟实验、分析结果,乃至撰写论文。其终点是完全自主的"AI科学家":整个计算化学都在机器上、由机器完成,无需人类监督。虽然我们尚未到达那一步,且目前所有已报道的系统都仍有人类在环,但趋势已不容误认。甚至连"构建专用于计算化学的智能体系统"这件事本身,也正在被通用智能体日益商品化;由于新增一项能力将简单到只需开口要求AI去做,通用智能体最终可能完全取代对专用系统的需求。系统数量的爆发,与它们在开发者之外极其有限的采用率,共同指向这一点。我们在本文结尾讨论这给我们留下了什么可做。智能体系统给计算化学带来的颠覆,其速度与规模,让我们中的许多人——无论是已经立足的专家、教师还是学生——对这一领域的未来、以及我们应当把精力投向何处感到茫然,而我们没有答案。

图1 | 调查中每一个智能体系统首次公开出现的时间。插图给出每年的数量与增长速率;2026年仅统计至2026年8月8日的截止日。我们自己的Aitomia与Protomia以彩色标出。

一、什么被交给了机器

计算化学是从计算硬件与软件进步中获益最多的研究领域之一,这些进步不断提升了模拟的规模、时间尺度、精度与实用性。这也造就了对大量专家的需求——他们要能执行这些高度非平凡、需要多年打磨技艺的模拟,而这反过来又为计算化学最佳实践的更广泛推广设置了实质性的门槛。

然而,许多单个计算任务本身相当重复,且遵循标准流程。因此人们一直希望将这些重复劳动自动化,传统做法是脚本与工作流。遗憾的是,这类自动化并没有减轻人类专家的负担,因为他们的工作与决策随之被推向更高层次:构思与规划算什么、怎么算,设置计算,编写脚本,监控其完成情况,分析结果与失败原因,调整方案,重算失败或错误的模拟,等等。

本文作者之一(P.O.D.)早在引发当前这波浪潮的对话式模型发布前一年,就已在文章中提出这一愿景:机器能够"执行所有这些模拟、分析结果并撰写论文",并最终"在我们对自然的理解上实现质的飞跃"。随着GPT-4与现代AI智能体系统的出现,这已成为可能——它们有望完成那些此前只有人类才能完成的任务:即时做出决策,最终让没有多年专业训练的研究者也能使用计算化学。

意识到AI的这一突破性潜力,许多课题组着手构建专用于计算化学的智能体系统;而随着后文将讨论的通用智能体的出现,这件事本身也变得更容易。其结果是计算化学智能体的爆发式增长(图1):2024年出现4个,2025年12个,截至2026年8月8日我们的调查覆盖了33个。调查范围限定为那些以原子级模拟为对象、由AI使用量子化学、分子动力学或机器学习势方法,对分子、材料或催化表面完成设置、运行与解读的系统。

在如此短短两年半的时间里,能力与架构的变化是剧烈的。目前这些系统已覆盖相当宽的计算化学任务范围(图2)。早期系统专精于一项或少数几项任务,而趋势是向更广泛的能力泛化。最常见的任务,也是任何计算工作流的"任务零",是生成结构——从把SMILES字符串嵌入三维空间,到生成数百个假想晶体并加以筛选。其次是分子动力学、电子结构与周期性密度泛函理论计算。

设计用于筛选、原子间势开发、激发态与自由能的系统要少得多。虽然过渡态与反应势垒是机理计算化学的核心业务,却只有少数系统涉及;考虑到这是计算化学中最具挑战性的任务之一,事后看来倒也不算意外。自由能出现12次,而如何获得自由能比计数本身更能区分这些工作:其中8个走静态路线,把简谐频率与理想气体熵转换为吉布斯自由能,以一次频率计算的代价得到pKa值、环张力、去质子化能与吸附自由能图;另外4个则对系综采样,通过伞形采样的平均力势、端点MM/PB(GB)SA结合能,以及自由能微扰与热力学积分家族(配合Bennett与多态Bennett估计量)来实现。总体而言,本调查在结构与动力学上覆盖广泛,而在反应机理上相当稀薄。

图2 | 被调查系统能做什么,以及其中有多少是读者真正可以获得的。对每项任务分别给出:执行该任务的系统数、声明了许可协议的系统数,以及无需安装即可运行的系统数。一个系统可执行多项任务,因此第一列的合计超过49。覆盖度与可获得性是两个不同的量:自由能、筛选与原子间势开发各有若干系统执行,却没有一个是读者无需安装即可运行的;而8个激发态系统中只有2个声明了许可协议。

二、有多少被交给了机器

从智能体系统演化的角度看,重要的不只是它们能做什么,还有它们能自主完成多少。作为通过统计分析回答这一问题的代理测度,我们把自主完成的工作"块"的大小分为若干档:从单次计算(例如几何优化),到一次计算机模拟实验(包含规划与执行一系列计算及其分析等),再到完成从构思直至撰写论文的全部任务。再往上是更大的"战役"(campaign)尺度的自主性——AI能够在一个限定范围的项目内完成一系列研究、产出多篇论文;以及最终的"议程"(agenda)尺度——完全无需人类干预地自行设定研究方向:定义研究什么、塑造项目、管理资源并推动其完成。后者才是计算化学研究端到端地在机器上、由机器运行之时。

这里的趋势同样不容误认,并与智能体系统的总体趋势一致:它们变得越来越有能力、越来越自主。早期系统通常在单次计算的尺度上工作,但很快转向了实验尺度的能力,这如今构成了主体。当前的前沿正把这些系统推向论文级,仅有少数系统声称达到,且尚无清晰证据表明它们能在无人监督下批量产出论文。没有任何系统报告了战役级的自主性,但公开报道滞后于前沿实验室当下的追求——也就是说,此类努力已在积极进行中,正如其他领域的类似尝试一样;我们能有把握这样断言,是因为我们自己的实验室也在追求这一目标。在该领域于战役级站稳之前,谈论议程级为时尚早,除非我们比想象中更快地抵达所谓的奇点(超级智能)。

图3 | 是什么在驱动智能体,以及一项研究中有多少被交给了它。(a) 各系统自己的论文所指明的编排器组件,按系统出现年份着色。每个系统只计一次,因此各行合计为其分组之和,四个分组合计为49。(b) 一项研究被委派的程度,按时代划分。"战役"与"议程"没有任何系统展示,且二者都无法在单篇论文内被证实。两种变化是同时发生的,本调查无法将其分离:所有运行于编码智能体之上的系统都出现在2026年,而2026年的系统无论由什么驱动,都被委派了更多的研究工作。

三、支撑自主性提升的架构演进

把智能体系统推向更高自主性,取决于架构的成熟度与底层AI(目前主要是大语言模型)的内在能力;而最先进的模型由私营公司构建,它们所追求的目标未必与"执行自主(计算化学)研究"的要求一致。因此,我们作为专家的工作,归结为把这些工具改造用于我们的研究目标——而它们极其快速的变化又使这件事变得复杂,造成开发上的显著滞后。我们的调查清楚地反映了这一点(图3a):早期专精于计算化学的智能体系统基于预定义的工具函数(在运行前写好并随系统一同发布),这曾是大语言模型唯一可调用的工具,其角色基本上是为这些工具挑选参数;也有一些偏离这一结构的做法,例如把软件文档喂给大语言模型并要求其生成输入文件。

后来的系统越来越依赖智能体自写代码(智能体在运行中撰写并执行的脚本)、模型上下文协议(MCP,让智能体调用并非随其发布的工具),以及技能库(一组可检索的书面流程,智能体据此行事以替代函数调用)来扩展能力。

编排层也相应演进:LangGraph曾是早期架构流行的主干,如今取而代之的是"一组松散的技能加一个通用智能体"。需要注意的是,技能中往往仍包含预定义函数,因此预定义层依然存在于架构之中;总体而言,新层是叠加在预定义层之旁,而非取代它。这一架构转变自然使智能体系统能够执行日益复杂的任务:早期系统通常只能执行预先定义好的任务序列,而现代系统通常能够在循环中工作——让一个结果决定接下来运行什么。

四、我们现在在哪里?终局是什么?

归根结底,在我们撰写此文的2026年8月18日,我们身处何处?使能计算化学的自主工具将会长期存在,我们看不到回到手写输入文件与脚本、手动检查计算进度、手工分析一切的可能。这些系统正变得更有能力、更值得信赖:它们可以不知疲倦地工作并核查自己的工作,还能按需派生子智能体来并行化工作,这已超出任何人类的能力。尽管如此,实践与我们的调查都表明,当前的智能体既不是自主的科学家,也不是听话的计算器:机器在用户设定的边界内完成工作,而人类专家的角色正更多地转向监督。

最大的挑战之一,是要判断这些系统究竟处于什么水平,正变得非常困难。评估一种新的计算方法,可以通过在已知参考值上跑基准来完成;而评估智能体系统需要人类判断,这是稀缺资源,加之AI模型与架构快速变化,实际上不可能把各个系统放在同等基础上比较。此外,任何基准一旦泄漏,就会污染对后续系统的评估。

已发表的声称也越来越难以验证:这既受制于此类评估在token上的成本,也因为许多系统既不公开代码,也不提供在线平台。对其中许多系统而言,读者在法律上是否可以复用其代码并不清楚。49个系统中有27个声明了许可协议,最常见的是MIT,例如我们自己的Aitomia采用Apache-2.0。其余22个我们未能找到任何许可协议,其中6个是任何人今天都能打开、却完全没有许可文件的代码仓库——这留给读者的是可以阅读、却不可复用的代码。多数系统既不附带测试也没有持续集成,还有若干系统按其发布状态根本无法运行:或缺少模块,或入口被注释掉,或残留着作者本机的硬编码路径。只有4个可以在不安装任何东西的情况下在线试用:TritonDFT、VASPilot、AutoSolvateWeb,以及我们自己的Protomia——后者是托管服务,并非开源发布。Aitomia是首个在在线平台上公开可用的通用计算化学智能体系统(自2025年5月11日起);它现已被Protomia取代,在本文中按其仍然保持的开源框架身份计入。

话虽如此,在单次计算的层面上,当前的智能体系统已相当稳健,我们和其他人的评估在一段时间以来都表明了这一点。在我们第一代智能体系统Aitomia的基准测试中,低自主度的单个计算任务成功率为99.6%;而当任务要求更高自主度时,这些数字降至70.9%45.6%。不过,这些基准基于已经过时的LangGraph架构,而我们最新的Protomia系统尚待评估(以及正式发表)。先简要预告Protomia已经能做什么:它提供实验级与论文级的自主性;在实验层面它处理得很有把握,但对于从构思到论文撰写这一工作尺度,它仍需要大量人工监督(图4)。

图4 | 我们自己的Protomia被要求做什么,以及返回了什么。上:仅凭"对于乙烯与1,3-丁二烯的Diels–Alder反应,反应能是多少?"这一个问题,它就准备好结构、运行计算,并返回反应能、焓与吉布斯自由能,自行选择并执行各个步骤。下:在之后的一次会话中,同一反应已用AIQM2算过,它被要求用LaTeX撰写一篇小论文并编译;它写出文档、完成编译并报告产出,交叉引用均已解析,且每一条经验性论断都带有出处,由一个确定性审计器在结束前完成核查。图片转载自Protomia文档,遵循CC BY 4.0协议。

我们自2024年开始做智能体系统以来的亲身体验,划出了一道很大的弧线:早期系统相当粗糙,却因偶尔闪现的出色决策而令我们着迷;如今我们却会因为它们没能按我们的口味写出一篇"完美"的论文,或在规划新研究时漏掉一个只有磨砺数十年的专家才觉得"显而易见"的推理缺陷,而感到沮丧。系统的能力增长了,但我们的胃口增长得更快。更客观地看:2025年我们开始在"计算化学与AI"课程中用Aitomia教学,发现新生在需要计算任何东西时会默认求助于它,但其早期版本还不足以支撑研究生水平的研究;2026年,我们已在课题组中使用Protomia开展研究,但带着下文所述的保留。

我们与其他团队的智能体系统之所以进步如此迅速,很大程度上要归因于通用编码智能体(如Claude Code、Github Copilot、Codex、Qoder,以及新兴的开源替代品)能力的提升。然而,正是这些把构建计算化学智能体系统的门槛压垮、从而导致其数量爆发的工具,讽刺地抬高了这些系统被开发者之外的任何人使用的门槛。对所有人来说,直接让一个通用编码智能体把活干完正变得更容易,而那些通用智能体的进步速度快于表1中的任何专用系统。而且一旦你的智能体系统归结为一组技能与MCP工具,它们就可以被通用编码智能体调用——这正是我们在该领域看到正在发生的事。一旦通用编码智能体能完成与专用系统相同的工作,并且它还支持自主研究能力(例如Claude Science),计算化学界对专用系统的需求就所剩无几,专家们只需像现在使用技能那样,把通用系统调整到自己的需求即可。

这已不再是推测:我们把自己的智能体系统免费公开在线,以求让模拟大众化,而实际采用比我们预期的更慢。尽管Protomia能做这么多,人们仍然很难跟上它。就连我们自己组里的多数成员也并不了解它的全部能力:我们最近惊讶地发现,其中一些人(在反复演示之后)仍未充分意识到Protomia可以在线修复他们的脚本,而是照旧把脚本复制粘贴到在线GPT对话里,再粘回HPC集群手动运行。组里另有许多成员更愿意用通用编码智能体来做研究。如果离一个免费且强大的系统最近的人都伸手去拿别的东西,那么这个领域的约束条件就不是这些系统能做什么。

我们未来的竞争者可能就是AI自身——当整个计算化学都在机器上、由机器完成之时;而其中的每一个组件都已存在于表1的某处,只是从未汇聚于同一个系统之中。而此刻,每一个构建智能体系统的人都在为自己掘墓,我们还在彼此竞争谁挖得更快、更深;这是我们的观点,我们在开启这波浪潮的GPT-4模型发布后数月内就已表达过,至今未变。

方法与局限

调查的文献截止日为2026年8月8日,以既有的三篇综述的参考文献、以及arXiv与ChemRxiv相关学科分类下的列表为起点向外扩展,并补充了同行提示的系统;因此该语料库并非单一可复现检索式的输出。系统按首次公开出现(预印本或期刊,以较早者为准)排序。

文中使用了两套标准,且分别陈述而非混用:科学任务以作者报告其自身系统执行该任务为准——即使缺少可运行的示例,只要能力已实现即计入;而被作者置于"未来工作"的任务,或由其仅仅引用的程序所执行的任务,则不计入。委派程度则采用更严格的标准,只计入论文正文中实际展示的内容,因为由此得出的论断关乎该领域实际走到了哪一步。此外,被有意排除在表格之外的相邻方向包括:逆合成、不含底层模拟的性质预测、机器人合成、第一性原理结果仅作为外部检验的材料信息学,以及以"做科学"而非"做化学"为目标的系统。

作者们明确记录了三条可能改变这些数字的局限:其一,我们读的是论文而非运行系统,因此每个计数衡量的是论文展示了什么,一个"做得比写得好"的系统会被低估;其二,我们无法估计自己的查全率——调查在准备期间从37个增长到49个,且多数新增来自本已存在、只是被我们检索遗漏的论文,因此这是一个下界;其三,所有归类均出自作者,未经独立复核。

关于生成式AI的使用,原文亦有明确披露:调查的组织、数据库的构建与本文中间版本的撰写,由**"AI Dral Group"(一个独立于底层运行时的AI研究智能体集体)完成;此处它运行在搭载Claude Opus 5模型(Anthropic)的Claude Code智能体之上,并使用Protomia**完成文献检索、引文核验与日期解析——而Protomia本身正是表1中被调查的系统之一。最终版本由P.O.D.撰写。作者指导并核验了每一个步骤,检查的是渲染后的图与排版后的页面而非源码,并对内容承担全部责任。

完整系统列表与原文

49个系统的完整表格(含任务、委派程度、架构与许可信息)见原文附录表1。完整原文(含全部参考文献)请见:

arXiv:2608.18508https://arxiv.org/abs/2608.18508


免责声明

本文为对以下预印本的中文编译,内容基于原文进行翻译与适应性改写,不构成原文的正式译本;如有出入,以原文为准。

原文:Pavlo O. Dral, Hassan Nawaz, Arif Ullah. "Science Done on a Machine by a Machine: AI Agents in Computational Chemistry". arXiv:2608.18508 (2026). DOI: 10.48550/arXiv.2608.18508

作者单位:厦门大学固体表面物理化学国家重点实验室、化学化工学院及福建省理论与计算化学重点实验室(中国厦门);波兰托伦哥白尼大学物理、天文与信息学院物理研究所,及该校高等研究院(波兰托伦);拟核科技(中国深圳);安徽大学物理学院(中国合肥)。通讯作者:Pavlo O. Dral(dral@xmu.edu.cn)、Arif Ullah(arif@ahu.edu.cn)。

原文以 CC BY 4.0 协议发布,本编译遵循该协议并署名原作者。图4转载自Protomia文档(CapabilitiesUsage Examples),同样遵循 CC BY 4.0 协议。