news 2026/10/2 12:40:52

Ornith-1.5-35B-A3B-GGUF 基准测试深度解读:SWE-bench 79分背后的智能体编程实力,附 GGUF 本地部署指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ornith-1.5-35B-A3B-GGUF 基准测试深度解读:SWE-bench 79分背后的智能体编程实力,附 GGUF 本地部署指南

Ornith-1.5-35B-A3B-GGUF 基准测试深度解读:SWE-bench 79分背后的智能体编程实力,附 GGUF 本地部署指南

【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF

Ornith-1.5-35B-A3B-GGUF 是开源智能体编程大模型的 GGUF 量化版仓库:350亿总参数混合专家架构(每 token 仅激活约 3B 参数),在 SWE-bench Verified 拿下 79 分、Terminal-Bench 2.1 拿下 68 分,全面超越同级稠密模型,支持 llama.cpp、Ollama 一键本地部署。

先看懂:Ornith-1.5 是什么来头?🐦

先给不熟悉 Ornith 的朋友补个背景。Ornith-1.5 是 ornith-ai 团队发布的端到端自我改进(self-improvement)基础模型系列中的中型 MoE(Mixture-of-Experts)成员:

  • 总参数约 35B,每 token 只激活约 3B 参数——这意味着推理成本接近一个小模型,却拥有大模型的"知识容量"
  • 在 Qwen3.5 与 Gemma4 基础上做继续预训练、中期训练与后训练,把自我改进闭环从"脚手架+rollout 优化"扩展到任务生成、脚手架构建、求解 rollout 的联合优化——模型持续自己生成训练任务、自己发现解题策略、再用强化学习自我提升
  • 核心卖点集中在编码与智能体(Agentic)能力,而非通用问答

官方完整的评测数据与部署说明都写在 README.md 里,本文就是逐节带你"拆"这份成绩单。

核心成绩单:SWE-bench 79分、Terminal-Bench 68分意味着什么?

SWE-bench 系列:真实 GitHub Issue 修复能力

基准测什么Ornith-1.5-35B-A3B
SWE-bench Verified真实开源项目的 Issue 修复(单补丁)79
SWE-bench Pro更复杂的真实工程任务59.6
SWE-bench Multilingual多语言代码库上的 Issue 修复71.4
DeepSWE深度长程软件工程任务22
NL2Repo自然语言描述 → 完整仓库46.2

SWE-bench Verified 79 分意味着:给它一个真实仓库和一个真实的 Issue,它平均每 10 次能独立完成 7.9 次修复。作为参照,稠密模型 Gemma-4-31B 只有 52 分——Ornith 以"每 token 激活 3B 参数"的体量,跑赢了体量相当或更大的稠密对手。

更值得关注的是 DeepSWE:Ornith-1.0 在此得 0 分,1.5 版本直接拉到 22 分(对照的 Qwen3.5-397B 也只有 1 分),说明自我改进训练对"长程、多步骤工程任务"的突破是实质性的。

Terminal-Bench 2.1:命令行智能体的实战分数

运行框架Ornith-1.5-35B-A3BQwen3.6-35B-A3BQwen3.5-397B
Terminus-2 框架67.852.553.5
Claude Code 框架68.549.248.6

Terminal-Bench 考验的是模型在终端环境中自主完成多步任务的能力——建环境、跑命令、看报错、改代码、验证结果。两个不同框架下 Ornith 都稳定在 67~68 分,说明分数不依赖特定 Agent 框架,而是模型本身的智能体素养。对比同为 MoE 的 Qwen3.6-35B-A3B(52.5 分)领先超过 15 个百分点,优势非常显著。

不只是会写代码:推理与工具调用全面开花

  • GPQA Diamond 89.2 分:研究生级科学问答,全场最高,推理底座扎实
  • HLE 33.4 分(with tools):使用工具时大幅提升,模型善于调用工具辅助解题
  • MCP-Atlas 70.2 分:MCP 工具调用能力位居前列
  • Frontier-Bench 5.1 分:前沿任务基准,是上一代 Ornith-1.0(1.4 分)的 3 倍多

一句话总结:编码、推理、工具调用三条腿都硬,且随版本迭代持续变强(对比 README.md 中的 Ornith-1.0 列即可看出每项几乎全部提升)。

为什么强?自我改进闭环的三个升级 ⚙️

Ornith-1.5 相对 1.0 的核心差异不在数据规模,而在训练方式的闭环升级:

  1. 任务自生成:不再依赖人工策划的固定任务集,模型持续生成新的训练任务
  2. 脚手架自构建:自动发现并优化解题所需的"执行框架"(harness)
  3. rollout 自优化:对任务的完整求解过程做强化学习,任务、脚手架、求解三者联合优化

这正是 DeepSWE 从 0 → 22 分、Frontier-Bench 从 1.4 → 5.1 分的来源——自我改进对"长程任务规划"的增益远大于对"短平快问答"的增益。

GGUF 版本怎么选?本地部署量化清单 📦

这个仓库的意义在于:用 llama.cpp 生态就能把这份成绩"搬"进你自己的机器。仓库提供了完整的量化阶梯:

文件精度适合谁
Ornith-1.5-35B-BF16.ggufBF16 全精度显存充足、追求极限质量(约 70GB 级)
Ornith-1.5-35B-Q8_0.ggufQ8_0接近无损,多数场景的推荐起点
Ornith-1.5-35B-Q6_K.ggufQ6_K质量/体积均衡
Ornith-1.5-35B-Q5_K_M.ggufQ5_K_M中显存主力选择
Ornith-1.5-35B-Q4_K_M.ggufQ4_K_M消费级硬件、追求最低显存

另有 mmproj-Ornith-1.5-35B-BF16.gguf 多模态投影文件,可用于视觉能力场景。

三步本地跑起来(llama.cpp):

  1. 从本仓库下载对应量化文件(clone 仓库:git clone https://gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF)
  2. 用llama-server起一个 OpenAI 兼容接口,加载 GGUF 文件并设置 256K 上下文
  3. 任何支持自定义 endpoint 的工具(Coding CLI、Agent 框架)把OPENAI_BASE_URL指过来即可

Ollama 用户更简单,一条命令:

ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF

上手建议:推理参数与长上下文设置 ✅

这个模型是推理模型:默认会在正式回答前输出一段<think>…</think>思考过程,部署时需要开启 reasoning parser 与 tool-call parser(如 vLLM 加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_xml),否则思考链和工具调用不会正确分离到reasoning_content/tool_calls字段。

采样参数建议(来自 README.md 官方推荐):

  • 日常使用:temperature=0.6、top_p=0.95、top_k=20
  • 复现基准成绩:temperature=1.0
  • 长上下文:原生支持 256K(262,144 tokens);任务超长时可启用 YaRN RoPE scaling 扩展到约 1M tokens——注意只有真的需要长窗口才开,避免影响普通长度的输出质量

结语:3B 激活参数,跑出大模型的成绩

回到开头的两个数字:SWE-bench Verified 79、Terminal-Bench 2.1 约 68。对一个小体量 MoE 模型来说,这组分数意味着它不是"会聊代码的聊天机器人",而是能独立修 Issue、自主操作终端的可用型编程智能体。

如果你是本地算力党,建议从 Q6_K 或 Q8_0 版本入手,在 llama.cpp / Ollama 里体验一把;如果你关注它的技术路线,README.md 里引用的 Ornith-1.5 官方博客值得细读——"自我改进闭环"可能是中小参数模型持续变强的关键路径。

【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 12:40:45

Java 扫雷游戏实战:从随机布雷到真正“能玩“的扫雷

一、整体思路 扫雷的核心其实就是一张二维表格&#xff1a; 用一个 LINE * LINE 的二维数组保存数据&#xff0c;-1 表示雷&#xff0c;0~8 表示这个格子周围有几个雷&#xff1b;随机生成坐标往数组里放雷&#xff08;练习1&#xff09;&#xff1b;遍历每个非雷格子&#xff…

作者头像 李华
网站建设 2026/10/2 12:39:44

通达信起爆启动点指标公式源码副图

EMA13:EMA(C,13);EMA34:EMA(C,34);EMA55:EMA(C,55);EMA120:EMA(C,120);ACB1:(C-REF(C,1))/REF(C,1)*100>0.5;ACB2:V>MA(V,5)*0.6;ACB3:COUNT(crOSS(EMA13,EMA55),3)1;ACB4:Abs(EMA34-EMA55)/EMA55< 0.03;ACB5:EMA55<EMA120 AND EMA55>REF(EMA55,1);峰火:FILTER(…

作者头像 李华
网站建设 2026/10/2 12:39:06

驭龙社徐一带领团队参与生物医药产业转化峰会

江苏苏州的生物医药产业园里&#xff0c;一场聚焦创新药产业转化的投资对接会正在举办&#xff0c;没有对外公开大规模宣传&#xff0c;所有参会者都是深耕生物医药产业多年的一线研发人员和产业投资人。徐一带着团队全程参与了这场没有媒体在场的深度交流&#xff0c;大家不用…

作者头像 李华
网站建设 2026/10/2 12:38:28

铜管表冷器进出水温差对制冷影响大吗?

铜管表冷器进出水温差对制冷效果影响极大&#xff0c;温差是否合理直接决定换热效率、降温速度与除湿能力&#xff0c;是表冷器稳定运行、发挥最佳制冷性能的核心关键。The inlet and outlet water temperature difference of copper tube cooling coils has a great impact on…

作者头像 李华