1. 核心问题
现有的AI系统能很好地理解科学意图和知识,但在将它们转化为具体的实验室操作时,往往会忽略物理世界的限制,例如:
样品必须守恒,不能凭空产生或消失。
容器有容量限制。
操作有先后依赖关系(必须先加热再测量)。
后续操作必须基于之前的测量结果(条件分支)。
一个计划可能在化学上很合理,但在物理上却无法执行。因此,需要一个“可计算”的物理实验室表示,让AI能理解并遵守这些规则。
2. 解决方案:一个三层框架
文章提出了一个包含三个层次的统一框架,将科学意图转化为可执行且合规的物理操作。
第一层:计算化的实验室状态-动作空间(表示层)
将实验室中的所有物体(样品、容器)和状态(质量、体积、位置、证据)定义为类型化的研究对象。
将每个实验操作(如“混合”、“加热”)定义为能力绑定的函数。每个函数都自带“合同”,明确规定了执行它的前提条件(MUST规则,如容器必须存在)和产生的效果。
第二层:工作流代数(组合层)
定义了5个核心操作符(序列、有限循环、条件分支、并行分叉-连接、保护区间),用于将基础操作组合成完整的实验流程。
这使得整个实验流程变成了一组可在计算机上检查和验证的程序,而非难以解析的文本。
第三层:可执行语义(执行与验证层)
在实际执行前,AI生成的“Python工作流”会经过结构分析(安全检查)和状态化模拟。
模拟器会逐行执行工作流,检查每个操作是否符合其“合同”。只有所有强制条件(MUST)都满足时,状态更新才会被“提交”;否则,工作流会被阻塞并返回详细的诊断信息,指导AI进行修正。这被称为“先验证-后提交”循环。
3. 实验验证与结果
为了验证该框架的有效性,研究团队在一个模块化的AI驱动实验室中实现了它,并设计了四个不同复杂度的化学任务来测试其能力。
| 任务 | 核心流程 | 关键测试点 |
|---|---|---|
| 任务1:NiFe催化剂合成与测试 | 比较五种不同的铁元素引入方法,并进行碱性析氧反应(OER)测试。 | 序列:验证了27步的线性复杂流程。 |
| 任务2:LDH催化剂合成、电化学氧化与多模式分析 | 合成催化剂,进行电化学氧化,然后将产物分到三个并行分析分支。 | 原子区间 + 并行分叉-连接:验证了复杂结构的组合与同步。 |
| 任务3:糠醛加氢与闭环GC优化 | 进行催化加氢反应,并迭代优化气相色谱(GC)的分离方法。 | 循环:验证了带有限次迭代的闭环优化。 |
| 任务4:ZnO合成与自适应光谱表征 | 合成纳米颗粒,并行进行红外和紫外-可见光谱表征,后者会根据结果自适应稀释。 | 条件分支 + 循环:验证了依据测量结果动态调整实验的能力。 |
结果:所有四个工作流都只使用了注册的合法操作,通过了结构分析和状态模拟,没有产生任何强制错误或警告,证明了该框架能生成复杂、合规且可验证的实验方案。
4. 核心贡献与局限性
核心贡献:该研究在“科学意图”和“物理执行”之间建立了一个通用的计算接口。它将协议、资源和操作统一到一个状态转换的语义中,为端到端的自主科学发现奠定了基础。
明确局限性:文章的验证仅限于软件模拟层面。它验证了实验计划在逻辑和物理规则上是合理的,但并未进行实际的湿实验室物理执行。因此,它不能保证化学结果的正确性或设备的绝对可靠性,这些是框架的扩展接口,而非隐藏的假设。
这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
摘要
使科学可计算化,需要同时表示科学知识和检验科学主张所依据的物理世界。物理实验室的可计算化表示,是通过类型化的研究对象、受能力约束的操作以及组合式工作流代数来建立的。它为机器可读的知识提供了物理世界的对应物,将工作流表达为作用于演化中实验室状态的程序,并包含显式的依赖关系、决策、迭代和并发。该表示在一个模块化的智能体机器人实验室中得以实现,方法是将形式化操作绑定到可执行的“功能技能”(Function Skills)上。针对不同的科学意图,生成了与能力相关的工作流,同时,有状态的模拟在分派前传播对象转换并验证操作前提条件和实验室约束。所提出的表示及其工程框架共同构建了一个通用的计算接口,连接了智能体推理与受能力约束的物理转换,为端到端的自主科学发现提供了基础。
可计算的实验室状态-动作空间
基于智能体的自驱动实验室将人工智能推理与用于合成、处理、反应、表征和分析的模块化系统相结合。1−3 其核心计算问题不仅仅是选择仪器。科学意图以语义方式表达,且可能变化无穷,而执行则必须保存样品、尊重容器和设备的限制、维护位置、处理顺序依赖关系,并根据测量结果来决定后续操作。因此,一个看似合理的方案可能在化学上有意义,但在物理上却不可行。化学编程语言提供了基本的操作词汇和控制结构,4−6 实验室协调器则协调仪器、资源和数据。7−9 因此,基于智能体的操作需要一个物理实验室的可计算表示,其中研究对象、实验室能力和控制逻辑都在一个共同的状态转换语义中被编码。
化学流程关联了物理操作、演化的样品和依赖测量的决策(图1a)。该表示将此流程抽象为可操作实验室的状态-动作系统——而非一个理想化的化学宇宙(图1b)。在工作流步骤 t,StSt 表示一个类型化研究对象的状态,包含其持久性标识以及结构化的样品、容器、证据和来源字段。一个操作是一个类型化的、绑定到工作站的函数 fi(θi),其契约声明了可接受的状态、参数、约束、效应、返回值和失败情况。当其强制性谓词得到满足时,该操作将状态 St 映射到 St+1 并记录证据;否则,它返回诊断信息而不改变受影响的模拟状态。因此,计算单元是一个受物理约束的状态转换,而不是一段自由文本指令或孤立的设备调用(补充说明1-2,补充表S1-S3,补充图S1和补充数据1)。
作为组合程序的工作流
基本转换通过五个算子组合成工作流(图1c)。顺序算子在各操作间传递状态。有界循环使迭代和非收敛性显式化。条件算子根据当前证据选择一个分支。并行的分叉-连接将对象投影到独立分支中,并协调兼容的更新。保护区间保持一个对资源敏感的代码块连续执行。工作流代数嵌套这些算子(图1d),使得科学流程可以被表达为作用于演化中实验室状态的程序。类型兼容性在顺序边界进行检查;循环需要有限边界;条件守卫必须解析到一个允许的分支;并行分支不能引入冲突的写入;保护块保持声明的顺序。因此,工作流抽象将实验逻辑转换为可组合且可被计算检查的结构(补充说明3-4,补充表S4,补充图S2和补充数据2)。
这种构造将科学合理性与操作可接受性分离开来。形式化层根据明确的能力清单测试后者,并且不能凭空发明不可用的操作。其生成空间是在五个算子下注册的基本操作的闭包。通用性是相对于能力的:转移操作要求每个实验室注册本地操作、约束和适配器。
工程化可执行语义
为了测试该表示是否可被操作化,我们将其在一个模块化的基于智能体的自驱动实验室中实现(图2)。1010 49个工作站的规格说明——45个物理的和4个虚拟的控制流模块——从结构化设备描述转换为智能体可读的“功能技能”(Function Skills)。冻结的快照暴露了63个函数,涵盖液体和固体处理、混合、加热、分离、反应、电化学测试、色谱、光谱、衍射、成像和控制流。每个功能技能保留了相应操作的契约,并在重复操作可能产生歧义时使用工作站限定的名称。这种编译将已安装的实验室转变为机器可读的能力空间,同时保持形式化表示独立于任何单一设备命令集。
科学意图由智能体翻译成一个Python工作流,其中只包含已注册的调用。在分派前,抽象语法树针对允许导入、函数和入口点的白名单进行检查,然后进行保守规范化。生成的程序进入一个共享的有状态模拟器。每个调用在应用效应之前,评估所有编码的强制性和建议性条件。强制性失败会阻止更新;成功的调用会提交新的对象状态并附加一个步骤记录。诊断信息定位到函数、步骤、观察到的条件、预期条件和建议的修正措施。这种“先验证后提交”的循环允许修改工作流片段,而无需将整个协议视为非结构化文本。它根据编码契约验证操作一致性;但并不证明化学真实性、超出这些规则范围的实验安全性或设备可靠性(补充说明5-7,补充表S5-S8,补充图S3-S6,补充数据1和4,以及附加文件1-2)。
图 2 | 可计算实验室工作流的工程化与检查。a,结构化规格注册了模块化智能体自驱动实验室的物理和虚拟能力。b,这些记录被编译成智能体可读的功能技能、共享运行时类型和模拟器函数,同时保留操作契约。c,科学意图被编译成一个包含已注册调用的Python工作流,通过抽象语法树分析进行准入,并在审查和下游序列化之前通过有状态模拟进行评估。成功的调用提交对象状态变更;失败的必须(MUST)谓词使模拟状态(SimState)保持不变,并返回一个本地化诊断集 \(\Delta_k\) 以供重新生成。此处,\(S_{i}\) 表示研究对象状态,而 SimState\(_t\) 表示模拟器使用的有界可执行投影。O0-O4 表示优化器级别,与这些状态符号无关。
基于科学意图的、与能力相关的工作流生成
我们使用四个指定了科学目标和控制逻辑但未指定完整工作站序列的提示词(扩展数据图1)来检验组合范围。第一个提示比较了五种Fe引入路线,用于在匹配的碱性析氧测试条件下制备NiFe基催化剂,并生成了一个跨越11个工作站的27节点序列。第二个提示将层状双金属氢氧化物合成和电极制备在一个保护区间内与HMF氧化耦合,然后将固体电极和液体产物对象分叉到三个分析分支;它包含22个物理节点、31个模拟步骤和11个工作站。第三个提示将糠醛加氢与一个有界气相色谱方法优化循环 (Nmax=6) 相结合,产生20个节点和23个模拟步骤。第四个提示将ZnO制备与平行的红外和紫外-可见表征耦合,并包含一个条件稀释循环 (Nmax=3),产生27个节点、30个模拟步骤和15个工作站。
所有四个被接受的工作流仅使用了已注册的能力,并通过了结构分析和状态模拟,没有强制性错误或建议性警告。这些案例涵盖了顺序、条件分支、有界迭代、分叉-连接并行和保护执行。它们不是四个硬编码的协议模板;每一个都是根据所需的对象转换和证据依赖关系,从共享操作中不同组合而成的(补充说明8-11,补充表S9-S11,补充图S7-S10,补充数据3和附加文件3)。
面向智能体实验室的表示层
近期的工作已在已有的编程和编排层之上,增加了基础实验室模式、文献到协议智能体以及模拟引导的优化。11−13 更广泛的进展包括模块化自驱动实验室架构、自主材料合成和分布式闭环发现,14−17 而知识图谱、自然语言机器人规划、编排中间件和以样品为中心的状态机则解决了实验室自主性的互补部分。18−2118−21 本工作的贡献在于统一了通常被分离的三个层次:物理研究对象的类型化表示、用于组合受能力约束的转换的代数,以及一个可执行的实现,该实现能够根据演化状态检查这些转换。与以协议为中心的表示不同,被转换的对象状态在整个生成、组合和检查过程中始终是一个显式的操作数。智能体推理因此通过一个显式的计算对象而非仅仅通过文本描述与物理行动相连接。
目前的检查是有意限定的。其有效性取决于工作站契约的完整性和模拟状态的保真度。调度器级别的资源隔离、实时遥测、设备故障、实验可重复性和化学结果需要执行证据或额外的模型。这些是扩展接口而非隐藏假设:约束、资源、观测和适配器可以在不改变意图层的情况下添加。因此,局部失败可以被归因于特定的对象、操作、守卫或连接点,而非整个工作流。通过使实验室状态、允许的转换和控制结构共同可计算,该框架为生成日益复杂的实验奠定了基础,同时确保其物理承诺在执行前是可验证的。
方法
研究对象与操作表示
在工作流步骤 t,St 表示一个类型化研究对象的状态。每个对象包含一个持久性标识符以及用于样品身份和组成、物相、数量、容器类型和状态、位置、证据及来源的类型化子记录。证据可能包含标量观测值或对生成数据的引用。工作站契约声明了操作所需的这些字段的投影。当前的模拟器实现了工作站检查所需的子集:容器标识符和类型、封闭状态、样品状态、体积、质量、位置、源瓶使用、步骤日志、错误和警告。
工作流组合
顺序通过函数组合定义,要求每个中间输出必须属于下一个操作的输入域。循环重复执行其主体,直到继续守卫变为假或达到声明的 Nmax;在边界处活跃的守卫返回一个非收敛诊断。条件组合要求有一个唯一的允许分支。并行的分叉-连接投影每个分支所需的对象,并且仅当分支写入集不冲突且共享更新一致时才允许连接。保护区间被约束为占据连续的调度位置。这五个算子可以递归嵌套。
能力编译
工作站能力以结构化记录或精心整理的技能文档形式提供。必需字段包括工作站标识、可用操作、接受的输入和输出状态、参数、界限、容器要求、状态效应和返回值。开发阶段的质量门控评估文档完整性;存档的配置接受达到必需字段评分60分的记录。接受的记录被转换为带工作站限定的接口、共享数据类和模拟器实现。冻结的清单包含28个合成、5个反应与测试、12个表征和4个虚拟规格说明,声明了63个函数。
结构分析与有状态模拟
生成的工作流是带有一个generate_recipe()入口点的Python模块。每个模块被解析为抽象语法树。准入只允许已注册的运行时导入和白名单中的函数调用,并拒绝通配符导入、动态调用、不支持的顶级语句、禁用名称和额外的函数定义。字面量算术和布尔表达式被折叠,非活跃的常量分支被移除,冗余的pass语句被消除。条件输出剪枝作为一个领域感知的转换是可用的,但在冻结的配置中被禁用。
对于模拟,重置共享状态,禁用人工延迟,并将已注册的工作站函数注入工作流命名空间。每个操作在应用任何效应之前收集所有适用的检查。检查涵盖容器存在性和数量、容器和样品状态、累积和单次调用的体积、质量、参数范围、文件约束以及声明的工作站依赖关系。诊断信息存储函数、步骤、代码、类别、预期值和观测值、参数快照、严重性和建议的修正措施。强制性诊断阻止继续执行。成功的操作提交状态变更并附加一个结构化的步骤记录。
案例构建与评估
四个提示要求:Fe配位环境调控和匹配的碱性析氧测试;层状双氢氧化物合成、电化学HMF氧化和并行分析;糠醛加氢与迭代气相色谱优化;以及ZnO合成与并行光谱分析和自适应稀释。未提供完整的工作站序列。智能体接收了控制器技能和已注册的功能技能。工作流生成智能体由 GPT-5.6 Sol (OpenAI) 驱动。本研究中使用的模型调用在2026年8月15日至25日之间执行。接受的工作流被序列化为规范的JSON格式,节点数、工作站数、模拟步骤数和诊断总数根据冻结的工作流和验证记录计算得出。本研究未实际执行任何工作流。
数据可用性
类型化能力注册表、形式化定义、四个提示、规范工作流表示、验证摘要和证据清单作为补充数据1-4提供。扩展数据图1中显示的四个案例的完整工作流和验证记录作为附加文件3提供。本研究报告的工作流未生成新的湿实验室测量数据。
代码可用性
功能技能转换、工作流分析、模拟和序列化的源代码作为附加文件1提供,冻结的功能技能库作为附加文件2提供。附加文件4包含仅供溯源用的内部发布页面记录;它不作为公共代码仓库、持久公共访问路径或DOI提供。