news 2026/8/22 17:40:01

Ornith-1.5: From Self-Scaffolding to Self-Improvement——从自我脚手架搭建到自我改进

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ornith-1.5: From Self-Scaffolding to Self-Improvement——从自我脚手架搭建到自我改进

一、核心贡献

Ornith-1.5 提出了一种端到端的自我改进框架,让大语言模型能够通过持续自我生成任务、构建解决方案脚手架、产出训练数据,形成一个闭环的自我提升系统。这是 Ornith-1.0 自我脚手架搭建框架的重大升级。

二、技术核心:三阶段自我改进循环

每个训练周期包含三个环节,且奖励信号会反向传播到所有环节:

阶段内容作用
任务生成模型基于当前能力和历史表现,提出比已解决任务更难的挑战,持续推动训练前沿暴露能力短板,自动构建课程
脚手架生成模型为每个任务生成或优化专属的指令、工具、分解策略和编排方案更高效地激发模型能力
解决方案生成模型产出具体的解决轨迹,用于强化学习训练提供学习信号,驱动参数更新

三个环节通过 GRPO 算法联合优化,形成“更强策略→更难任务→更好脚手架→更优轨迹→更强策略”的正反馈循环。

三、任务奖励机制

生成任务时,系统综合评估三个信号:

  1. 有效性:任务是否合法、可验证

  2. 前沿难度:当前模型在该任务上的成功率越接近 20% 越好(既具挑战性,又能产出足够成功轨迹用于 RL 训练)

  3. 新颖性:与历史任务库的差异度,防止重复生成相似任务

四、模型规格

版本架构特点
Ornith-1.5-397BMoE(混合专家)旗舰版,对标 Claude Opus 4.8
Ornith-1.5-35BMoE(每令牌激活 3B)高效推理,性能大幅超越同尺寸密集模型
Ornith-1.5-9BDense(密集模型)含量化移动版,可部署于手机端

三者均基于 Ornith-1.0(源自 Qwen3.5 + Gemma 4)进行额外的持续预训练、中期训练和后期训练。

五、核心性能表现

Ornith-1.5-397B(旗舰级)

基准测试Ornith-1.5Claude Opus 4.8DeepSeek-V4-FlashGLM-5.2
Terminal-Bench 2.186.185.082.782.7
DeepSWE56.059.054.446.2
SWE-bench Verified86.085.881.683.0
  • 与 Claude Opus 4.8 持平,超越所有同规模开源模型

Ornith-1.5-35B(MoE)

  • 在 Terminal-Bench 2.1 上达到68.5,远超 Gemma 4-31B(43.4)

  • 在 SWE-bench Verified 上达到79.0,大幅领先 Muse Glimmer(76.0)

  • 每令牌仅激活 30 亿参数,效率极高

Ornith-1.5-9B(端侧部署)

  • Terminal-Bench 2.1:47.0

  • SWE-bench Verified:70.6

  • 性能达到甚至超越 Gemma 4-31B 和 Qwen 3.6-35B 等大模型

  • 量化版可部署于 iPhone/Android

六、评估覆盖范围

论文在三大类基准上进行了全面评估:

  1. 编码类:Terminal-Bench 2.1、SWE-bench(Verified/Pro/Multilingual)、DeepSWE、NL2Repo、SWE Atlas 等

  2. 推理类:HLE(含/无工具)、GPQA Diamond

  3. 智能体类:MCP-Atlas、Toolathlon-Verified、WideSearch、BrowseComp、ClawEval

七、技术亮点

  1. 摆脱对人工数据与人工设计智能体的依赖:完全由模型自主生成任务和策略

  2. 课程自动演进:前沿难度随模型能力动态调整

  3. 反黑客保护:评估中移除 Git 历史、禁用网络、屏蔽外部仓库访问,防止奖励作弊

  4. 跨规模可扩展:从 9B 端侧模型到 397B 旗舰模型均验证有效

Ornith-1.5 的核心突破在于让模型成为自身进步的工程师——它自己出题、自己想解题思路、自己练题,形成可持续的自我进化闭环,在编码、推理和智能体任务上达到或超越当前最先进的闭源与开源模型。

今天,我们推出 Ornith-1.5,这是朝着通过端到端自我改进构建基础模型迈出的重要一步。Ornith-1.5 将 Ornith-1.0 中引入的自我脚手架搭建框架扩展为一个更完整的自我改进循环:模型提出新任务,生成针对特定任务的脚手架,并生成用于强化学习的解决方案轨迹,从而持续创造新的学习经验,并从中进行自我提升。

Ornith-1.5 涵盖三种模型规模:397B MoE、35B MoE 和 9B Dense。它是在 Ornith-1.0 的基础上扩展而来,后者基于 Qwen3.5 和 Gemma 4 开发,并进行了额外的持续预训练(CPT)、中期训练和后期训练。Ornith-1.5 在广泛的推理、编码和智能体基准测试中,在同等规模的开源模型中达到了最先进的性能。

2026/8/20 13:32 Ornith-1.5:从自我脚手架搭建到自我改进 | Ornith 博客

Ornith-1.5-397B 在 Terminal-Bench 2.1 上得分为 86.1,在 DeepSWE 上得分为 56.0,性能与 Claude Opus 4.8(85.0 和 59.0)相当,同时优于同规模领先的开源模型,包括 GLM-5.2(82.7 和 46.2)和 DeepSeek-V4-Flash-0731(82.7 和 54.4)。在另一端,Ornith-1.5-9B 及其量化版本 Ornith-1.5-9B-Mobile 可轻松部署在 iPhone 和 Android 设备上,同时性能显著优于 Gemma 4-31B 和 Qwen 3.6-35B 等更大规模的模型。

在旗舰级规模上,Ornith-1.5-397B 在 Terminal-Bench 2.1 上达到 86.1,在 DeepSWE 上达到 56,在两个基准测试中均与 Claude Opus 4.8 持平,并优于同尺寸的领先开源模型,包括 GLM-5.2 和 DeepSeek-V4-Flash-0731。

2026/8/20 13:32 Ornith-1.5:从自我脚手架搭建到自我改进 | Ornith 博客

Ornith-1.5-35B 在所有编码和智能体基准测试中均显著优于其同尺寸竞品 Qwen 3.6-35B。尽管每个令牌仅激活 30 亿参数,它在智能体编码任务上也大幅超越了密集模型——Gemma 4-31B 和 Meta 的 Muse Glimmer-30B(Terminal-Bench 2.1 得分为 68.5 对比 43.4 和 51.7;SWE-Bench Verified 得分为 79.0 对比 52.0 和 76.0)。

可边缘部署的 Ornith-1.5-9B 也交出了非常亮眼的成绩单,在 Terminal-Bench 2.1 上达到 47.0,在 SWE-Bench Verified 上达到 70.6。尽管是一个紧凑的 90 亿参数模型,它的表现却达到甚至超越了 Gemma 4-31B 和 Qwen 3.6-35B 等大得多的模型。

通过自生成任务、工具包和解决方案实现自我改进

Ornith-1.5 扩展了 Ornith-1.0,将自我改进循环从脚手架和轨迹优化扩展为联合优化任务生成、脚手架构建和解决方案轨迹生成。Ornith-1.5 不再依赖固定的人工策划任务集和手动设计的工具包,而是持续生成新的训练任务,发现解决这些任务的有效策略,并通过强化学习改进策略。

每个训练周期分为三个阶段。给定一个环境或代码库、关于任务类型的高级指令,以及模型先前任务解决历史的访问权限,系统会提出逐步更难的任务,这些任务超出了模型已能解决的范围,从而暴露能力差距,持续推动训练前沿。

对于每个任务,模型随后会生成或改进一个针对特定任务的脚手架——即用于处理该问题的指令、工具、分解策略和编排方案。以任务和脚手架为条件,策略生成一个解决方案轨迹。来自轨迹的奖励会反向传播到所有三个阶段,因此系统不仅学会产生更好的解决方案,还学会生成更有用的训练任务和构建更有效的脚手架。

通过反复训练,这就形成了一个封闭的自我改进循环:更强的策略能够生成更难、信息量更丰富的任务;不断演进的脚手架发现更好方法来激发模型能力;更高质量的轨迹提供越来越有效的学习信号。Ornith-1.5 不再依赖于静态的训练数据分布或人工设计的智能体方案,而是持续扩展自身的课程并调整其问题解决策略,从而在推理、编码和智能体任务上驱动持续的能力提升。

任务奖励

其中,V 衡量生成的任务和脚手架是否构成一个有效且可验证的学习环境,D 基于轨迹执行表现衡量任务是否位于模型当前能力前沿附近,N 衡量相对于先前生成或训练过的任务的新颖性。这种乘积形式的公式鼓励提议者生成同时满足所有三个属性的任务:有效难度恰当非冗余

有效性与可验证性

一个有用的任务必须形成一个定义良好的学习环境。问题应当连贯且可解,而脚手架应当能够正确执行并可靠地评估候选解决方案。我们定义

V(q,s)∈[0,1]

基于以下检查:脚手架是否成功运行、高置信度解决方案是否通过、明显错误的解决方案是否失败,以及评估是否与任务规范一致。有效性也可以作为一个硬性门控条件:

V(q,s)=0 ⟹ Rtask=0.

这可以防止格式错误的任务或不可靠的脚手架仅仅因为看似困难而获得奖励。

前沿难度

在有效的任务中,最有用的那些既非微不足道,也非不可能完成。我们直接从模型的轨迹执行结果来估算难度。

对于每个任务,我们采样 N 条轨迹并计算经验成功率

新颖性与多样性

仅靠前沿难度可能导致模型反复生成相同任务的微小变体。因此,我们增加了一个新颖性项:

其中 B 是先前生成或训练过的任务的缓冲区。新颖性应当次于有效性和难度:其作用是减少冗余,而非奖励任意不寻常的任务。

这些信号共同鼓励提议者生成有效可验证具有挑战性但可学习足够多样化的任务。由于前沿难度是使用当前模型自身的轨迹来衡量的,由此产生的课程将随模型能力自动演进。

工具包与轨迹奖励

对于生成的问题 q,工具包 h 因提供一个与任务对齐、忠实反映解决方案质量、且对奖励黑客行为具有抵抗力的评估环境而获得奖励:

其中,C 衡量工具包是否忠实地反映了任务规范,F 衡量其奖励是否能追踪候选方案的真实质量,H 衡量其对评估器失败、捷径和奖励黑客行为的抵抗能力。

每个轨迹 τi​ 由生成的工具包直接评分:

对于可验证的任务,这可以是一个二进制的通过/失败奖励;对于更丰富的环境,它可以结合正确性、任务完成度、效率和约束满足。问题生成、工具包生成和解决方案轨迹都使用各自的奖励通过 GRPO 进行优化,使得这三个阶段能够在同一个自我改进循环中共同提升。

结果评测

Ornith-1.5-397B

BenchmarkOrnith-1.5
(397B)
DeepSeek-V4-Flash-0731
(284B)
GLM-5.2
(753B)
Claude Opus 4.8Kimi K3
(2.8T)
Ornith-1.0
(397B)
Coding
Terminal Bench 2.1 (Terminus-2)86.182.7818588.377.5
Terminal Bench 2.1 (Claude Code)85.281.882.778.978.2
SWE-bench Verified8681.68385.886.282.4
SWE-bench Pro65.164.462.16862.2
SWE-bench Multilingual79.677.978.475.778.9
DeepSWE5654.446.25967.58
Frontier-Bench v0.113.56.15.121.1232.7
NL2Repo59.554.248.969.748.2
SWE Atlas – QnA55.651.65059.759.741.2
Reasoning
HLE (no tools)44.63540.549.843.530.2
HLE (with tools)56.150.854.757.95647.5
GPQA Diamond92.891.491.293.693.588.1
Agentic
MCP-Atlas8074.677.882.282.376.4
Toolathlon-Verified71.270.348.276.273.243.2
WideSearch80.877.37972.975.2
BrowseComp86.684.885.684.391.279.7
ClawEval81.477.678.880.277.1

Ornith-1.5-35B

BenchmarkOrnith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31B
(dense)
Muse-Glimmer-30B
(dense)
Qwen3.5-397B
(397B)
Coding
Terminal Bench 2.1 (Terminus-2)67.864.252.542.151.753.5
Terminal Bench 2.1 (Claude Code)68.562.849.248.6
SWE-bench Verified7975.673.4527676.4
SWE-bench Pro59.650.449.535.751.251.6
SWE-bench Multilingual71.469.367.251.769.3
DeepSWE22001
Frontier-Bench v0.15.11.41.41.4
NL2Repo46.234.629.415.536.8
SWE Atlas – QnA39.837.115.520.4
Reasoning
HLE (no tools)25.620.821.419.52228.7
HLE (with tools)33.430.128.926.548.3
GPQA Diamond89.286.28684.383.588.4
Agentic
MCP-Atlas70.264.462.85575.572.3
Toolathlon-Verified48.742.441.740.838.3
WideSearch67.863.460.154.274
BrowseComp67.663.56278.6
ClawEval72.569.868.748.570.7

Ornith-1.5-9B

BenchmarkOrnith-1.5-9BOrnith-1.0-9BQwen3.5-9BQwen3.6-35B-A3BGemma-4-31B
(dense)
Coding
Terminal Bench 2.1 (Terminus-2)46.243.121.352.542.1
Terminal Bench 2.1 (Claude Code)4740.618.949.2
SWE-bench Verified70.669.453.273.452
SWE-bench Pro47.542.931.349.535.7
SWE-bench Multilingual54.45239.767.251.7
NL2Repo32.427.216.229.415.5
SWE Atlas – QnA20.617.99.215.5
Reasoning
HLE (no tools)20.216.814.721.419.5
HLE (with tools)30.526.424.528.926.5
GPQA Diamond86.482.581.78684.3
Agentic
MCP-Atlas54.249.446.862.855
Toolathlon-Verified41.233.429.641.752.8
WideSearch59.555.853.660.154.2
BrowseComp56.444.841.562
ClawEval66.563.153.268.748.5

脚注

  • 所有报告的 Ornith-1.5 结果是五次独立运行的平均值。

  • Terminal-Bench 2.1 (Terminus-2):我们使用 Harbor/Terminus-2 框架评估 Terminal-Bench 2.1,设置 parser=json,temperature=1.0,top_p=1.0,上下文窗口为 128K。每次运行使用 4 小时超时时间,配备 32 个 CPU 核心和 48GB RAM,结果取 5 次运行的平均值。我们调整了 Qwen 聊天模板以确保训练和推理之间的一致性,并修改了 Harbor 以适配 vLLM 的 reasoning_content 键。

  • Terminal-Bench 2.1 (Claude Code):我们使用 Claude Code 2.1.126 评估 Terminal-Bench 2.1,设置 parser=json,temperature=1.0,top_p=1.0,max_new_tokens=131072。结果取 5 次运行的平均值。同样,需要修改 Qwen 聊天模板。

  • SWE-Bench Verified, Pro 和 Multilingual:使用 OpenHands 工具包进行评估,设置 temp=1.0,top_p=0.95,上下文窗口为 256K。整个评估过程中应用了反黑客保护措施:从本地仓库镜像中移除 Git 历史记录,以防止模型访问先前的解决方案或提交记录;禁用网络访问,防止模型检索外部信息或资源。

  • DeepSWE:使用 Claude Code 工具包进行评估,设置 temperature=1.0,top_p=0.95,上下文窗口为 256K。

  • SWE Atlas QnA, RF, TW:使用 mini SWE agent 工具包进行评估,设置 temp=1.0,top_p=0.95,上下文窗口为 128K。结果取 5 次运行的平均值。

  • NL2Repo:设置 temperature=1.0,top_p=1.0,上下文窗口为 400K,输出长度为 48K。阻止访问指定的 GitHub 仓库和 pip 包,以防止奖励黑客行为。

  • HLE:使用 Claude 4.6 Opus 作为评判模型进行评估。

  • MCP-Atlas:所有模型均以思考模式在 500 个任务的公开子集上进行评估,每个任务超时时间为 10 分钟。我们使用 Claude 4.8 Opus 作为评判模型。

  • Tool-Decathlon:我们使用官方评估服务,最大令牌限制设为 128K。

  • ClawEval:一个基于真实用户任务分布的智能体编码基准测试;设置 temp=0.6,上下文窗口为 256K。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/22 17:38:53

美赛A题复盘:环境性别决定的种群动力学建模与生态反馈分析

1. 项目概述与核心问题拆解去年带队参加美赛,A题“七鳃鳗性别比例变化对生态系统的影响”让不少队伍直呼“抽象”。题目给了一个看似简单的背景:七鳃鳗这种生物,其性别比例并非由遗传决定,而是受环境资源(尤其是食物丰…

作者头像 李华
网站建设 2026/8/22 17:38:50

济南能华机电设备远程供电系统落地应用指南

在偏远地区部署监控或监测设备时,最让人头疼的往往不是设备安装本身,而是“电从哪里来”。很多项目现场位于深山、海岛或是高速公路的隔离带,距离最近的市电接入点动辄几公里甚至十几公里。传统做法是拉设长距离电缆,不仅施工周期…

作者头像 李华
网站建设 2026/8/22 17:38:07

大厂Java技术栈与微服务面试实战解析

1. 互联网大厂Java技术栈全景解析当我在阿里P7晋升答辩现场被问到"请完整描述你掌握的技术栈"时,突然意识到大厂对技术体系化掌握的要求远超想象。互联网大厂的Java技术栈通常呈现明显的分层特征,就像建造一栋高楼需要从地基到装修的完整施工方…

作者头像 李华
网站建设 2026/8/22 17:36:41

C++静态与非静态成员函数指针的本质区别与实战应用

1. 从一次调试经历说起:为什么成员函数指针让我“踩坑”那天下午,我正在调试一个用C和Qt写的模块,里面用到了信号与槽。我设计了一个回调机制,想把一个类的成员函数作为回调参数传给另一个管理器对象。代码看起来很简单&#xff0…

作者头像 李华
网站建设 2026/8/22 17:36:36

虎鲸全 5 个 AI 动作一次讲透:一句话生成跨语言回归

虎鲸自动化把"写脚本"变成了"说人话"。本文把它的 5 个 AI 动作一次讲透,并用一个跨语言回归实例,演示一句话生成可执行用例的全过程。 5 个 AI 动作分别干什么 虎鲸的 AI 引擎由 5 个动作组成,覆盖自动化用例的"看…

作者头像 李华
网站建设 2026/8/22 17:33:31

Spring Boot + Vue 民宿管理系统:预订、房东运营、收支管理与后台实现-----源码12199

摘要民宿管理系统围绕租客、房东和管理员三类角色构建完整业务流程。普通用户可以浏览民宿资讯、咨询房源、在线订房、查看订单、申请退房并提交反馈;房东负责民宿信息维护、用户咨询答复、订单审核、退房处理和收支明细记录;管理员统一管理用户、平台内…

作者头像 李华