摘要
基础模型的快速发展,使得AI科学家可以自动化完成越来越完整的科研工作流,从假说生成、代码执行一直到稿件撰写。但仅靠完整工作流,并不能获取科学发现所依赖的全部证据。现有系统大多仅对文本、代码、标签或者预计算摘要做推理,科学研究中起决定性作用的空间、时序、跨通道、过程类关系无法被智能体获取。本文提出端到端全模态AI科学家OmniScientist,直接基于异构原始证据开展多学科研究。系统包含感知层,以及构思、实验、撰写3套自主智能体,整套运行于确定性流水线中;在整个科研生命周期内,观测结果可以不断塑造研究问题、实验决策与最终科学论断。系统通过代码执行想法校验、严谨性校验、论断校验,实现新颖性筛选、统计有效性校验、执行溯源、数值可追溯。本文在36个真实数据案例上开展评估,覆盖5大学科门类、4大类科学证据,模态包含图像、信号、音频、视频、3维结构、轨迹、表格、公式、图表。全部36个案例下系统均可完成从原始数据到成文稿件的完整流程;使用参考推理主干模型时,生成论文平均综合得分为6.3分。与仅接收预计算标量特征的消融对照版本做配对对比,直接感知原始证据在全部7项评价维度上均获得提升,头对头评测中85%场景胜出。结果表明,覆盖全生命周期的感知能力是基于证据开展科学发现的必要条件,该工作为构建能力广泛的AI科学家提供可行实现路径。
haofei7419@gmail.com
#多模态智能体 #自主科研 #科学发现 #大语言模型智能体 #工具调用 #AI科学家
图1OmniScientist框架总览
左侧为来自多学科的多模态原始观测数据,输入至统一科学引擎;
引擎完成证据感知、可证伪实验执行,每条科学论断均锚定真实证据(中间)。
该连续流水线最终输出跨多个领域可验证的科学发现(右侧)。
相关工作
智能体推理与编排
表1测试套件:5大类学科,36个案例,每个案例对应1份可下载真实数据集,标注样本数量N
证据分为感知类、符号类、定量‑统计类、过程类;模态包含图像、信号、谱图、音频、视频、3维、轨迹、表格、公式、序列、场、图表
图23个示范案例从原始证据到验证发现的完整流程
3行分别展示地震学、病理学、3维CAD案例工作流。每行从左至右依次为原始证据(3通道地震记录、染色病理切片、3维CAD模型),提取得到的结构性线索,后续假说与行动序列;最右侧列为经过验证的发现,例如21.7%标记为噪声的标签实际对应真实事件。底部展示预计算特征接口:原始材料被压缩为特征向量,造成结构性关系丢失,研究问题空间收窄。
问题设定
科学证据
表2 OmniScientist能够感知的4大类科学证据
OmniScientist系统框架
感知层
图3OmniScientist系统架构
顶部:来自多学科的原始证据输入系统,分为感知、符号、定量统计、过程4大证据大类,合计12种模态。
核心流水线包含3个顺序阶段。
①构思阶段(左侧):观测材料、检索文献,构建可证伪假说。
②实验阶段(中间):设计测试、执行代码、检视结果,生成包含标准输出、图片、数据、配置的执行记录。
③撰写阶段(右侧):仅从执行记录选取、锚定、报告得到支撑的论断,编译生成最终稿件。
底部:全生命周期感知层,提供空间、时序、跨通道、统计、动态分析能力;
虚线箭头代表感知工具对流水线全部3个阶段均可用。
图416个案例、11种模态、全部4类证据的原始观测与对应发现总览
感知层处理的16个案例原始观测与得到的发现,覆盖11种模态、全部4类证据大类。4行4列排布案例材料,每个面板左上角标注学科,右上角标注模态。红色方框标记智能体在原始记录上标记的关键特征。材料下方「SAW」代表智能体完成的直接观测,「FOUND」代表由该观测得到的经过验证实验结果。前3行是感知、过程类证据,覆盖图像、谱图、信号、音频、视频、3维结构、轨迹;底行是定量、符号类证据,直接读取表格、公式、序列、图的原生数值结构,而不渲染图片。
实验阶段
图5实验结果与稿件论断2阶段校验流水线
从上至下从左至右:未验证实验结果首先进入严谨性校验,核查真实执行、全部测试计入统计、独立性与泄露、头条结果必须来自受支撑分析;校验失败则追溯未支撑分析,0结果触发重新构思。校验通过输出带溯源信息的已验证结果。下1步进入论断校验:将报告数值与记录输出匹配、报告论断和分析过程匹配,最终输出全部数值、论断均可追溯的稿件。底部是执行记录,作为2项校验的事实依据;记录包含数据IO、标准输出、生成图片、全部尝试测试清单(含失败测试)。
撰写阶段
算法1 代码强制退出校验:结果溯源、反虚构、反HARKing伪假说检验
伪代码,逻辑:报告结果不为空、代码实际运行成功;报告全部数值必须出现在标准输出;
数据集必须从磁盘加载;报告p‑value要对全部已执行测试做多重检验校正;
头条发现必须来自受支撑分析;未支撑的非头条分析保留在执行记录;
全部校验通过才接受该结果
实验评估
实验设置
表3 不同推理主干下详细评审打分
0‑10分,2名跨学科评审
主要结果
表4 36案例套件下各主干模型完成情况
分配案例数、成功产出稿件数、成功案例综合平均分
机制分析
表7 2套系统特征利用对比
对比5个配对案例:原始记录独有的信息;
感知版本提出的科学问题;盲版本提出的科学问题
案例研究1:地震数据集审计
图11 地震审计结果总览
左:4条振幅归一化3分量地震波形;第1条标记地震(参考),第2条是真正平稳背景噪声;后2条标签为噪声,但在虚线位置出现相干起振,STA/LTA峰值达到地震记录上4分位,起振直线度接近1。
右:完整检测器检出噪声记录占比(附带95%置信区间),对比3套标签无关对照;移除跨通道符合项后检出率回落至仅振幅基线水平,证明跨通道时序符合是核心机制。
案例研究2:儿科胸部X光片中纹理特征
图12 滑动窗口局部熵特征可视化与评测
局部熵特征可视化与分类性能。
左侧:正常、肺炎胸片,配对对应的局部熵热力图;展示样本为每类斑块度中位数样本。肺炎熵图方差更高,呈现斑驳外观,正常样本熵图相对平滑。
右侧:留出集分类AUC;熵衍生特征0.840‑0.851,显著优于原始像素基线0.634;判别信号来源于局部空间模式,而不是原始像素强度。
表10 儿科胸片案例系统输出数值结果
包含效应量d、Mann‑Whitney检验p值、各项AUC、窗口消融效应量
数据与代码
开源仓库
https://github.com/Omni‑Scientist/OmniScientist
项目主页
https://omni‑scientist.github.io
详细总结
思维导图
论文基础信息
4类科学证据体系
3大智能体分工
7维评审打分指标
0‑10分,双评委盲评
36案例测试套件学科分布
不同基座整体表现
36案例
6个案例实验结局统计
参考
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
https://arxiv.org/abs/2608.13558
注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。