news 2026/8/25 4:40:50

新国立×牛津:全模态、全学科AI科学家

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
新国立×牛津:全模态、全学科AI科学家

摘要

基础模型的快速发展,使得AI科学家可以自动化完成越来越完整的科研工作流,从假说生成、代码执行一直到稿件撰写。但仅靠完整工作流,并不能获取科学发现所依赖的全部证据。现有系统大多仅对文本、代码、标签或者预计算摘要做推理,科学研究中起决定性作用的空间、时序、跨通道、过程类关系无法被智能体获取。本文提出端到端全模态AI科学家OmniScientist,直接基于异构原始证据开展多学科研究。系统包含感知层,以及构思、实验、撰写3套自主智能体,整套运行于确定性流水线中;在整个科研生命周期内,观测结果可以不断塑造研究问题、实验决策与最终科学论断。系统通过代码执行想法校验、严谨性校验、论断校验,实现新颖性筛选、统计有效性校验、执行溯源、数值可追溯。本文在36个真实数据案例上开展评估,覆盖5大学科门类、4大类科学证据,模态包含图像、信号、音频、视频、3维结构、轨迹、表格、公式、图表。全部36个案例下系统均可完成从原始数据到成文稿件的完整流程;使用参考推理主干模型时,生成论文平均综合得分为6.3分。与仅接收预计算标量特征的消融对照版本做配对对比,直接感知原始证据在全部7项评价维度上均获得提升,头对头评测中85%场景胜出。结果表明,覆盖全生命周期的感知能力是基于证据开展科学发现的必要条件,该工作为构建能力广泛的AI科学家提供可行实现路径。

haofei7419@gmail.com

#多模态智能体 #自主科研 #科学发现 #大语言模型智能体 #工具调用 #AI科学家

图1OmniScientist框架总览

左侧为来自多学科的多模态原始观测数据,输入至统一科学引擎;

引擎完成证据感知、可证伪实验执行,每条科学论断均锚定真实证据(中间)。

该连续流水线最终输出跨多个领域可验证的科学发现(右侧)。

相关工作

智能体推理与编排

表1测试套件:5大类学科,36个案例,每个案例对应1份可下载真实数据集,标注样本数量N

证据分为感知类、符号类、定量‑统计类、过程类;模态包含图像、信号、谱图、音频、视频、3维、轨迹、表格、公式、序列、场、图表

图23个示范案例从原始证据到验证发现的完整流程

3行分别展示地震学、病理学、3维CAD案例工作流。每行从左至右依次为原始证据(3通道地震记录、染色病理切片、3维CAD模型),提取得到的结构性线索,后续假说与行动序列;最右侧列为经过验证的发现,例如21.7%标记为噪声的标签实际对应真实事件。底部展示预计算特征接口:原始材料被压缩为特征向量,造成结构性关系丢失,研究问题空间收窄。

问题设定

科学证据

表2 OmniScientist能够感知的4大类科学证据

OmniScientist系统框架

感知层

图3OmniScientist系统架构

顶部:来自多学科的原始证据输入系统,分为感知、符号、定量统计、过程4大证据大类,合计12种模态。

核心流水线包含3个顺序阶段。

①构思阶段(左侧):观测材料、检索文献,构建可证伪假说。

②实验阶段(中间):设计测试、执行代码、检视结果,生成包含标准输出、图片、数据、配置的执行记录。

③撰写阶段(右侧):仅从执行记录选取、锚定、报告得到支撑的论断,编译生成最终稿件。

底部:全生命周期感知层,提供空间、时序、跨通道、统计、动态分析能力;

虚线箭头代表感知工具对流水线全部3个阶段均可用。

图416个案例、11种模态、全部4类证据的原始观测与对应发现总览

感知层处理的16个案例原始观测与得到的发现,覆盖11种模态、全部4类证据大类。4行4列排布案例材料,每个面板左上角标注学科,右上角标注模态。红色方框标记智能体在原始记录上标记的关键特征。材料下方「SAW」代表智能体完成的直接观测,「FOUND」代表由该观测得到的经过验证实验结果。前3行是感知、过程类证据,覆盖图像、谱图、信号、音频、视频、3维结构、轨迹;底行是定量、符号类证据,直接读取表格、公式、序列、图的原生数值结构,而不渲染图片。

实验阶段

图5实验结果与稿件论断2阶段校验流水线

从上至下从左至右:未验证实验结果首先进入严谨性校验,核查真实执行、全部测试计入统计、独立性与泄露、头条结果必须来自受支撑分析;校验失败则追溯未支撑分析,0结果触发重新构思。校验通过输出带溯源信息的已验证结果。下1步进入论断校验:将报告数值与记录输出匹配、报告论断和分析过程匹配,最终输出全部数值、论断均可追溯的稿件。底部是执行记录,作为2项校验的事实依据;记录包含数据IO、标准输出、生成图片、全部尝试测试清单(含失败测试)。

撰写阶段

算法1 代码强制退出校验:结果溯源、反虚构、反HARKing伪假说检验

伪代码,逻辑:报告结果不为空、代码实际运行成功;报告全部数值必须出现在标准输出;

数据集必须从磁盘加载;报告p‑value要对全部已执行测试做多重检验校正;

头条发现必须来自受支撑分析;未支撑的非头条分析保留在执行记录;

全部校验通过才接受该结果

实验评估

实验设置

表3 不同推理主干下详细评审打分

0‑10分,2名跨学科评审

主要结果

表4 36案例套件下各主干模型完成情况

分配案例数、成功产出稿件数、成功案例综合平均分

机制分析

表7 2套系统特征利用对比

对比5个配对案例:原始记录独有的信息;

感知版本提出的科学问题;盲版本提出的科学问题

案例研究1:地震数据集审计

图11 地震审计结果总览

左:4条振幅归一化3分量地震波形;第1条标记地震(参考),第2条是真正平稳背景噪声;后2条标签为噪声,但在虚线位置出现相干起振,STA/LTA峰值达到地震记录上4分位,起振直线度接近1。

右:完整检测器检出噪声记录占比(附带95%置信区间),对比3套标签无关对照;移除跨通道符合项后检出率回落至仅振幅基线水平,证明跨通道时序符合是核心机制。

案例研究2:儿科胸部X光片中纹理特征

图12 滑动窗口局部熵特征可视化与评测

局部熵特征可视化与分类性能。

左侧:正常、肺炎胸片,配对对应的局部熵热力图;展示样本为每类斑块度中位数样本。肺炎熵图方差更高,呈现斑驳外观,正常样本熵图相对平滑。

右侧:留出集分类AUC;熵衍生特征0.840‑0.851,显著优于原始像素基线0.634;判别信号来源于局部空间模式,而不是原始像素强度。

表10 儿科胸片案例系统输出数值结果

包含效应量d、Mann‑Whitney检验p值、各项AUC、窗口消融效应量

数据与代码

开源仓库

https://github.com/Omni‑Scientist/OmniScientist

项目主页

https://omni‑scientist.github.io

详细总结

思维导图

论文基础信息

4类科学证据体系

3大智能体分工

7维评审打分指标

0‑10分,双评委盲评

36案例测试套件学科分布

不同基座整体表现

36案例

6个案例实验结局统计

参考

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

https://arxiv.org/abs/2608.13558

注:AI辅助创作,如有不当欢迎指出。内容仅供参考,不构成任何建议。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 4:39:31

技术面试突围:从算法刷题到工程思维的全方位提升

1. 技术能力与求职脱节的深层原因很多程序员在面试后经常陷入困惑:明明技术测试题都答对了,项目经验也符合要求,为什么最终拿不到offer?这个问题背后隐藏着技术岗位招聘的复杂逻辑。从我的十年招聘经验来看,技术实力只…

作者头像 李华
网站建设 2026/8/25 4:37:17

彻底解决Windows F1键误触弹窗问题:从原理到实战方案

最近在 Windows 系统上办公或玩游戏时,你是否也遇到过这样的烦心事:本想按下 F1 键寻求帮助或执行某个快捷键操作,结果却意外弹出一个浏览器窗口,显示“获取有关 Windows 的帮助”页面?这个突如其来的弹窗不仅打断了你…

作者头像 李华
网站建设 2026/8/25 4:34:03

链表反转:面试必备算法与工程实践

1. 链表反转问题的重要性链表反转是数据结构与算法领域最经典的入门问题之一,也是技术面试中出现频率最高的题目。根据2023年LeetCode官方统计数据显示,#206反转链表题目在Top100高频面试题中排名第7,在亚马逊、微软等大厂的面试中出现率高达…

作者头像 李华
网站建设 2026/8/25 4:31:34

华为OD机试:定位爆破点技术与性能优化实战

1. 项目概述:华为OD机试中的定位爆破点技术 在华为OD(Huawei Outsourcing Development)的机试环节中,"定位爆破点"是一个高频出现的核心考点。这个技术点主要考察开发者对程序性能瓶颈的精准定位能力,以及针…

作者头像 李华
网站建设 2026/8/25 4:27:08

AI Agent技能调校实战:从70+技能中精选配置Hermes Agent

1. 项目概述:从“技能焦虑”到精准调校如果你最近也在关注AI Agent领域,尤其是围绕Claude的生态,那么“Hermes Agent”这个名字你一定不陌生。它就像一个为Claude打造的“超级工具箱”,通过引入Skills(技能&#xff09…

作者头像 李华
网站建设 2026/8/25 4:25:09

基于多仓群路由算法的美国海外仓价格对比与履约优化实践

针对中大件出海场景,美国海外仓价格对比不仅是商务问题,更是技术调度问题。本文基于行业数据,探讨如何通过分布式仓网路由算法优化尾程派送,实现35%的成本降幅。深度解析头部服务商5大仓群24仓架构下的WMS调度逻辑与系统选型指南。…

作者头像 李华