学术前沿

可用性与可扩展性:化学领域下一代大型语言模型代理的核心要求

来源:

时间:2026.04.16

分享:

  大型语言模型(LLMs)凭借其先进的语言理解与生成能力,为加速科学发现提供了强大的机遇。LLMs正日益广泛地应用于文学分析、假设生成等科学领域。将LLMs应用于化学领域需要进行领域特定的适配,因为该领域依赖于分子结构、反应方程式、光谱数据、表格数据集等多模态数据,以及复杂的多步骤工作流程。

  鉴于这些需求,一个前景广阔的解决方案是将它们封装在具备化学认知能力的大型语言模型(LLM)代理中,并通过整合外部资源(如化学数据库和模拟工具)来增强其功能。这些代理旨在自主执行多步骤任务,或与人类研究人员协作——包括规划并执行实验、提出合成路径、查询化学信息库,以及管理复杂的多工具研究流程。


  尽管已取得显著进展,但研究人员往往独立开发其工具,而不同系统间有效的交互或复用因框架和数据格式缺乏一致性而受到阻碍。模块化设计通常缺失,这限制了基于大语言模型的工作流程的可扩展性和适应性,需要在模型调优、工具集成和提示工程等领域具备深厚的编程专业知识。这对更广泛的化学研究社区构成了重大障碍,往往仅限于具有专门计算背景的研究人员
用这些工具。


  本文从设计角度探讨了在化学领域构建高效大语言模型(LLM)代理系统的关键考量,特别强调易用性与可扩展性。尽管单代理和多代理框架均已取得进展,但现有架构仍存在碎片化、标准化程度有限以及难以广泛普及等问题。为解决这些挑战,我们主张开发基于标准化协议的开放、模块化、易用且可扩展的代理架构,以实现系统间的互操作性与协同工作。其中,我们重点介绍了模型上下文协议(MCP)——该协议规范了代理与外部数据及工具的集成方式;以及代理间协议(A2A)——该协议定义了代理之间的通信与协调机制。这些举措共同为构建互操作性生态系统奠定了基础,使未来的多代理系统能够支持更高效、自动化且协作化的科研工作流程。



单智能体是化学领域应用的大语言模型( LLM) 智能体的基本单元 。这类智能体通常基于单一LLM实例构建, 并通过多种策略进行增强, 包括提示工程 、检索增强生成( RAG) 、外部工具集成以及模型微调, 以执行特定领域的任务。


  提示工程是将通用大语言模型应用于化学任务最轻量且最易上手的方法 。通过精心设计提示, 研究人员能够激发化学推理 、实现文本到结构的转换, 或从文献中提取结构化数据。这种方法无需额外基础设施即可快速完成原型开发 。然而, 有效的提示设计既需要化学专业知识, 又需理解大语言模型的行为特性, 这对许多领域科学家而言颇具挑战。此外, 基于提示的方法往往缺乏鲁棒性和可重复性, 不同任务间的性能表现不一致; 同时它们高度依赖具体模型, 需要针对不同架构和版本进行调整。


  RAG将外部知识源(包括科学语料库 、向量数据库 、结构化数据库和知识图谱) 整合到大型语言模型的生成过程中, 从而提升其输出结果的事实准确性和上下文相关性 。这种方法在处理超出LLM原始预训练语料库范围的专业查询时尤为有效 。例如, 将LLM与知识图谱结合使用, 可在框架材料研究中提供准确且可追溯文献来源的答案; 而ChatMOF则利用结构化数据库根据性能指标推荐材料 。尽管具有这些优势, RAG仍面临文档分块 、检索策略及集成工作流程等技术挑战 。对许多化学家而言, 搭建或调整RAG系统仍较为困难, 主要原因是软件工具 、数据库结构和知识图谱缺乏标准化, 且其应用程序接口(API) 和使用范式存在不一致性。


  将大语言模型( LLMs) 与领域特定的化学工具相结合——例如化学信息学库(如 RDKit)、模拟软件包(如Gaussian 、 gromacs)以及自动化分析工具——能够显著提升其在科学工作流程中的实际应用价值 。这种整合使大语言模型从被动辅助工具转变为能够执行有意义化学计算的主动智能体。包括计算 、分子结构可视化及反应模拟 。尽管这些集成系统具有巨大潜力, 但它们通常通过高度定制的Python脚本实现, 缺乏标准化API或可组合的架构 。对于编程能力不强的化学家而言, 复制 、调整或扩展此类系统仍面临重大挑战。


  在领域特定的化学数据上对大型语言模型进行微调, 能够提升任务特定的准确性 、领域适应性及推理能力。对于需要深入理解化学原理或进行多步骤推理的任务, 微调后的模型通常表现优于基础模型 。基于配体及结构-性质数据训练的微调模型已被证明能显著提升配体设计与材料优化的推荐效果 。然而, 微调过程也伴随着高昂的训练成本和繁重的维护需求: 随着基础模型的持续演进, 微调版本会迅速过时, 需要持续重新训练以跟上科学进展的步伐。



随着单个智能体的能力不断提升, 它们在处理涉及不同模式 、工具及决策层级的复杂多步骤化学工作流程时的局限性日益凸显 。受分布式认知系统的启发, 多智能体系统( MAS)通过为特定任务的智能体分配职责, 提供了一种极具前景的替代方案。

因此, 多智能体系统能够扩展功能以支持复杂的化学工作流程 。如图1a所示, 最简单的实现方式依赖人工协调——科学家手动调用并管理智能体 。虽然这种方式能让经验丰富的化学家充分发挥领域知识优势, 但随着智能体数量的增加, 认知负担会迅速加剧 。这类系统特别适用于解决涉及长期规划 、迭代反馈循环以及与实验室仪器或模拟平台集成的实际化学挑战; AutoGen  、CrewAI和LangGraph等框架已成功展示了其概念验证成果。

图 1b所示的另一种方案引入了一个主机代理, 该代理能够自主代表用户选择并调用其他代理 。然而, 实现此类系统需要标准化代理定义和交互协议——无论是通过新的统一代理 、脚本语言(例如 Python、JavaScript) 、基于 HTTP 的API, 还是第三方框架(如 Dify) 。此外, 系统中添加的每个新代理都必须集成到主机代理的提示逻辑和交互模式中。

尽管多智能体系统化学具有巨大潜力, 但由于存在若干关键障碍, 其实际应用仍十分有限。

(1) 这种通信方式缺乏透明性 。代理之间的消息通常以自由格式文本或系统提示的形式进行编码, 缺乏结构和可追溯性, 从而阻碍了调试工作。

(2) 部署摩擦 。这些系统通常与基于Python的代码库紧密耦合, 并需要本地环境配置, 从而限制了非计算化学家的使用权限。

(3)  缺乏标准化 。由于缺乏通用的通信协议或工具API, 导致集成与复用变得复杂, 增加了开发工作量及出错风险。

在复杂的化学研究中, 单一智能体与多智能体系统具有巨大的潜力 。然而, 当前的实际应用往往仅限于孤立的原型系统, 缺乏互操作性和系统协同效应, 从而限制了其全部功能 。要构建一个高效 、协作且可扩展的智能体生态系统, 必须实现从定制化的“ 工作坊式” 开发向基于开放标准和共享协议的“ 工业化”协作模式的范式转变 。这一转型的核心在于统一智能体接口规范 、通信协议及评估基准的制定。



诸如MCP和A2A等标准化协议在LLM代理开发的特定阶段最为适用, 而非在整个研究过程中统一要求使用 。在早期探索性研究中, 当主要目标是评估可行性或生成初步的化学假设时, 轻量级且紧密耦合的实现方案通常已足够 。然而, 当需要从文献中提取化学信息的工具, 或将LLM与现有化学工具结合以探索材料相关性质的工作流程供广大研究人员使用, 或需整合到共享的研究流程中时, 标准化接口便成为必要 。例如在金属有机框架( MO- Fs)领域, 大量研究独立开发了基于LLM的文献提取工具, 这些工具通常依赖于为类似信息检索任务新设计的提示词, 导致不同项目间的复用性有限 。在这些已被广泛研究的领域中, 缺乏标准化接口和可复用组件导致了重复劳动——因为类似的工具总是需要根据特定任务的需求和临时性集成逻辑进行反复重构 。由于缺乏标准化, 这些工具不仅难以维护和扩展, 还会给用户带来持续负担 :他们必须不断适应各工具特有的界面和工作流程 。因此, 本节讨论的架构旨在支持智能体系统实现持续 、共享且社区层面的应用, 通过将常用功能封装为可互操作的组件, 使其能够在不同研究环境中更便捷地组合和复用, 从而减少终端用户在提示工程和手动集成方面的工作量。

迄今为止, 语言模型在化学领域的应用一直面临整合异构数据源的挑战: 每种新资源都需要编写定制化的接口代码, 这不仅导致效率低下, 还限制了智能体的扩展能力 。MCP通过提出统一标准来解决这一问题, 该标准规范了智能体如何共享和访问外部数据 、工具及服务中的信息 。简而言之, MCP定义了一种通用的“语言”, 供智能体和外部资源共同使用进行通信 。当智能体需要信息时——例如从数据库中检索分子或调用模拟服务——它会通过MCP发送标准化请求, 而资源则会以智能体能够立即理解并使用的格式进行响应。

MCP的优势在构建稳健的单一代理时尤为明显 。通过标准化数据结构 、请求-响应格式和认证机制, MCP使单个代理能够以最小的开销明确表达其意图 、发现资源 、调用服务, 并将返回的信息进行整合 。以逆向合成规划为例:若不使用MCP, 将规划代理连接到多个反应数据库时, 需要为每个资源分别构建定制适配器; 而借助MCP, 代理可通过统一的标准接口查询所有数据库,自动解析结果, 并无缝将其传递给下游的条件优化或仿真工具。

这不仅提升了系统的稳定性, 还提高了开发效率以及单个智能体的独立解决问题能力 。MCP降低了整合外部工具和知识的门槛, 促进了科研资源的模块化, 并推动了领域专业知识向服务化转型 。通过这种方式, 它为在化学人工智能生态系统中构建智能体提供了高度兼容且可扩展的基础 。从实际应用角度来看, 与基于脚本的工作流程相比, 采用MCP会带来额外的工程成本和实施成本——因为符合MCP标准的工具通常以服务形式提供, 需要进行接口定义 、部署和维护 。对于许多依赖该技术的化学研究团队而言, 这一转变具有重要意义。




对于自学成才的程序员而言, 这种面向服务的模型可能会提高初始的技术门槛 。实际上, 通过采用封装式或容器化的MCP实现方案, 可以有效缓解这些挑战——这类方案在简化部署流程的同时, 仍能保持标准化接口 。此类部署策略还支持本地化及本地部署环境下的运行, 使基于MCP的系统能够与现有的数据管理实践无缝集成, 从而增强对数据隐私和安全的管控能力 。这样一来,即可在推进标准化进程的同时, 避免增加专有或敏感化学数据的公开风险。

然而, MCP在实际应用中并非没有局限性 。在实践中, 符合MCP规范的工具描述和模式可能占据大语言模型上下文窗口的相当大比例 。随着可用工具或服务数量的增加, 累积的协议信息会加重单个智能体的认知负担, 使其在进行复杂推理时更难保持专注 。这一局限性并不意味着MCP本身存在缺陷, 而是反映了智能体设计中更广泛的系统层面考量 。随着任务范围和工具多样性的持续扩大, 强调任务分解与多智能体协作的架构策略变得愈发重要 。与此同时, 学界正就是否最终需要超越MCP的替代机制展开积极讨论 。基于当前模型能力与研究实践, MCP仍是标准化智能体工具交互的务实且有效的解决方案。

鉴于单一智能体通常不足以完成复杂的化学任务, 需要标准化机制来促进智能体间的协作 。A2A协议通过提供一个通用框架来应对这一挑战, 该框架明确了消息格式 、交互模式 、服务发现及信任管理机制 。简而言之,A2A为智能体提供了统一的通信

与协作“规则集”, 即使这些智能体是在不同平台或由不同团队开发的。

从用户角度来看,A2A的核心价值并不在于提升单个智能体的推理能力, 而在于简化来自不同研究人员 、项目或代码库的基于智能体工具的集成过程 。通过提供标准化的交互层,A2A使用户能够将独立开发的智能体整合到统一的工作流程中, 无需进行紧密耦合或大量手动调整 。从这个意义上说,A2A促进了多样化研究成果的复用与组合, 而非单纯优化智能体的内部智能性能。

传统上, MAS系统的实现存在通信不透明的问题: 智能体通过自由格式的文本或提示进行信息交换, 导致其推理步骤难以追踪和调试 。A2A通过强制采用结构化且透明的消息格式来解决这一局限, 这些格式能够保留意图 、上下文及信息来源 。例如, 在逆向合成规划中, 合成设计智能体可向条件优化智能体传递结构化的反应条件请求, 后者随后生成标准化输出结果, 可供实验室控制智能体直接使用 。在此工作流程中, 每个信息传递环节都保持可解释 、可审计和可复现的特性——这是自由文本通信无法保证的。

然而, 需要强调的是,A2A并非所有基于代理的工作流都必需 。对于范围狭窄的任务或高度集成的流程, 配备直接调用工具功能的单一代理即可提供更简洁且更可靠的解决方案。




用户驱动的集成何时能从多智能体协调中获益, 而何时采用更简单的编排方案即可满足需求——这一边界问题仍是当前活跃的讨论焦点, 并且随着语言模型和智能体框架的持续发展, 该边界很可能不断演变。

从实际应用的角度来看, 采用A2A架构会增加系统层面的复杂性, 这种复杂性主要影响开发人员和维护人员, 而非最终用户 。实现符合A2A标准的智能体通常需要采用服务式部署模式 、明确的接口定义, 以及智能体发现与通信机制 。对于许多依赖自学编程人员的化学研究团队而言, 这种额外的复杂性会提高开发和维护成本 。因此, 基于A2A的设计最适合用于那些生命周期较长 、涉及多位研究人员或团队协作 、且需要明确职责分离和可复用接口的工作流程。

此外, 基于A2A(Agent-to-Agent) 的系统在数据访问和安全方面存在诸多考量, 尤其是在代理跨越组织或网络边界运行时 。实际上, 这些问题可通过本地部署策略结合受控访问机制来解决 。此类方案既能实现代理间的结构化协作, 又能为专有或敏感化学数据提供完善的保护措施, 从而在开放性与保密性之间取得平衡。

通过使智能体能够识别任务请求 、协调职责并完成基于反馈的决策,A2A最终构建了一个协调统一且功能强大的多智能体系统(图1c) 。该协议促进了能力互补与涌现智能, 打破了孤立开发的壁垒, 构建了一个开放且相互连接的人工智能智能体网络 。这样的网络显著提升了集体应对复杂科学与工程挑战的能力。

在现行的学术评估机制下, 投入额外工程精力进行标准化和协议合规性工作, 对学生和博士后研究人员而言往往只能带来有限的短期收益——因为出版指标主要侧重于科学创新性和研究成果的卓越性 。这一点在基于大型语言模型( LLM) 的智能体作为内部研究原型开发时尤为明显: 其可用性需求仅限于少数专业开发人员使用 。相比之下, 当智能体系统旨在作为面向非专业化学家的用户工具时, 标准化带来的即时效益首先会惠及读者和用户,表现为使用便捷性提升 、系统互操作性增强, 以及更无缝地融入科研工作流程 。随着这类工具得到更广泛的应用, 其广泛的使用反过来又能间接为原始开发者和机构带来长期效益——通过实现更高效的迭代更新 、维护工作以及持续的技术演进。



在此背景下, 为实现上述愿景, 需要制定一系列具体措施, 将协议层面的标准转化为可实际应用的设计原则 。这类举措在以下场景中尤为有益 :基于大语言模型的智能体需要在多个研究团队间共享 、作为长期实验室基础设施持续维护, 或部署于转化医学及工业应用场景——在这些场景中, 互操作性和复用性的优势明显超过额外的开发成本 。这些举措将MCP 、A2A等抽象协议定义与实际部署需求相衔接, 确保智能体不仅具备互操作性, 还具有开放性 、模块化 、用户友好性和可扩展性 。图2展示了支撑化学领域下一代大语言模型智能体系统开发的四大基础支柱。

(1) 开放原则 。倡导在公共存储库中公开共享化学数据 、代码和模型, 以确保结果可重复并促进合作 。开放性也为公平的基准测试奠定了基础, 因为公开可用的数据集和模型使不同研究团队能够在一致条件下评估和比较智能体系统。

(2) 模块化设计 。通过MCP 协议标准化所有大型语言模型( LLM) 和工具的接口, 采用模块化设计原则 。这种标准化使得代理 、工具和数据源能够作为可互换模块灵活组合成工作流 。这种即插即用特性减少了重复劳动, 提升了可移植性, 并确保生态系统以连贯且可扩展的方式发展。

(3) 实用性强 。通过提供易于部署的解决方案, 确保代理系统具备用户友好的访问体验和简便的本地部署流程 。这包括提供代理服务或交付即插即用的客户端软件包(例如基于容器化技术(如 Docker) 或一键安装工具实现的方案), 从而降低研究人员和最终用户的使用门槛。


(4)  可扩展性 。通过要求用于集成的代理提供符合A2A标准的接口以及描述其功能的标准化数字“代理卡片”, 来提升系统的可扩展性和互操作性 。这确保新代理能够无缝集成到现有系统中, 从而让研究人员能够逐步扩展工作流程。






基于LLM的智能体正开始重塑化学家进行发现 、设计和实验的工作方式 。然而, 如果进展仅限于孤立的原型阶段, 其全部潜力将无法得到充分发挥 。未来的重大突破将取决于构建一个标准化 、模块化且支持协作的生态系统, 该系统能够将单一的概念验证系统转化为化学科学领域的可持续基础设施。

要实现这一愿景, 仅靠技术进步是不够的 。它需要整个社区对开放数据和代码共享的共同承诺, 采用MCP和A2A等通用协议,并开发模块化智能体组件以降低使用门槛 。在这些基础条件具备后, 智能体将变得广泛可用, 使来自不同背景的化学家都能将其整合到研究实践中。

此类集体行动所带来的回报是巨大的 。一个真正开放且可扩展的智能体生态系统将加速科学进步, 催生新型合作模式, 并揭示目前尚无法实现的科学发现 。我们呼吁研究人员 、开发者及各类机构共同参与这一事业, 携手构建一个智能体生态系统, 从而推动下一代化学创新的发展。


来源:《中国科学报》


作者:白雪峰 、张欣 、王浩天 、郑志玲与李建荣



  • GAI
    工具
  • Copyright © 知孔(上海)科技发展有限公司 沪ICP备2025111862号-2