Ornith-1.5-35B-A3B-GGUF 基准测试深度解读:SWE-bench 79分背后的智能体编程实力,附 GGUF 本地部署指南
【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF
Ornith-1.5-35B-A3B-GGUF 是开源智能体编程大模型的 GGUF 量化版仓库:350亿总参数混合专家架构(每 token 仅激活约 3B 参数),在 SWE-bench Verified 拿下 79 分、Terminal-Bench 2.1 拿下 68 分,全面超越同级稠密模型,支持 llama.cpp、Ollama 一键本地部署。
先看懂:Ornith-1.5 是什么来头?🐦
先给不熟悉 Ornith 的朋友补个背景。Ornith-1.5 是 ornith-ai 团队发布的端到端自我改进(self-improvement)基础模型系列中的中型 MoE(Mixture-of-Experts)成员:
- 总参数约 35B,每 token 只激活约 3B 参数——这意味着推理成本接近一个小模型,却拥有大模型的"知识容量"
- 在 Qwen3.5 与 Gemma4 基础上做继续预训练、中期训练与后训练,把自我改进闭环从"脚手架+rollout 优化"扩展到任务生成、脚手架构建、求解 rollout 的联合优化——模型持续自己生成训练任务、自己发现解题策略、再用强化学习自我提升
- 核心卖点集中在编码与智能体(Agentic)能力,而非通用问答
官方完整的评测数据与部署说明都写在 README.md 里,本文就是逐节带你"拆"这份成绩单。
核心成绩单:SWE-bench 79分、Terminal-Bench 68分意味着什么?
SWE-bench 系列:真实 GitHub Issue 修复能力
| 基准 | 测什么 | Ornith-1.5-35B-A3B |
|---|---|---|
| SWE-bench Verified | 真实开源项目的 Issue 修复(单补丁) | 79 |
| SWE-bench Pro | 更复杂的真实工程任务 | 59.6 |
| SWE-bench Multilingual | 多语言代码库上的 Issue 修复 | 71.4 |
| DeepSWE | 深度长程软件工程任务 | 22 |
| NL2Repo | 自然语言描述 → 完整仓库 | 46.2 |
SWE-bench Verified 79 分意味着:给它一个真实仓库和一个真实的 Issue,它平均每 10 次能独立完成 7.9 次修复。作为参照,稠密模型 Gemma-4-31B 只有 52 分——Ornith 以"每 token 激活 3B 参数"的体量,跑赢了体量相当或更大的稠密对手。
更值得关注的是 DeepSWE:Ornith-1.0 在此得 0 分,1.5 版本直接拉到 22 分(对照的 Qwen3.5-397B 也只有 1 分),说明自我改进训练对"长程、多步骤工程任务"的突破是实质性的。
Terminal-Bench 2.1:命令行智能体的实战分数
| 运行框架 | Ornith-1.5-35B-A3B | Qwen3.6-35B-A3B | Qwen3.5-397B |
|---|---|---|---|
| Terminus-2 框架 | 67.8 | 52.5 | 53.5 |
| Claude Code 框架 | 68.5 | 49.2 | 48.6 |
Terminal-Bench 考验的是模型在终端环境中自主完成多步任务的能力——建环境、跑命令、看报错、改代码、验证结果。两个不同框架下 Ornith 都稳定在 67~68 分,说明分数不依赖特定 Agent 框架,而是模型本身的智能体素养。对比同为 MoE 的 Qwen3.6-35B-A3B(52.5 分)领先超过 15 个百分点,优势非常显著。
不只是会写代码:推理与工具调用全面开花
- GPQA Diamond 89.2 分:研究生级科学问答,全场最高,推理底座扎实
- HLE 33.4 分(with tools):使用工具时大幅提升,模型善于调用工具辅助解题
- MCP-Atlas 70.2 分:MCP 工具调用能力位居前列
- Frontier-Bench 5.1 分:前沿任务基准,是上一代 Ornith-1.0(1.4 分)的 3 倍多
一句话总结:编码、推理、工具调用三条腿都硬,且随版本迭代持续变强(对比 README.md 中的 Ornith-1.0 列即可看出每项几乎全部提升)。
为什么强?自我改进闭环的三个升级 ⚙️
Ornith-1.5 相对 1.0 的核心差异不在数据规模,而在训练方式的闭环升级:
- 任务自生成:不再依赖人工策划的固定任务集,模型持续生成新的训练任务
- 脚手架自构建:自动发现并优化解题所需的"执行框架"(harness)
- rollout 自优化:对任务的完整求解过程做强化学习,任务、脚手架、求解三者联合优化
这正是 DeepSWE 从 0 → 22 分、Frontier-Bench 从 1.4 → 5.1 分的来源——自我改进对"长程任务规划"的增益远大于对"短平快问答"的增益。
GGUF 版本怎么选?本地部署量化清单 📦
这个仓库的意义在于:用 llama.cpp 生态就能把这份成绩"搬"进你自己的机器。仓库提供了完整的量化阶梯:
| 文件 | 精度 | 适合谁 |
|---|---|---|
| Ornith-1.5-35B-BF16.gguf | BF16 全精度 | 显存充足、追求极限质量(约 70GB 级) |
| Ornith-1.5-35B-Q8_0.gguf | Q8_0 | 接近无损,多数场景的推荐起点 |
| Ornith-1.5-35B-Q6_K.gguf | Q6_K | 质量/体积均衡 |
| Ornith-1.5-35B-Q5_K_M.gguf | Q5_K_M | 中显存主力选择 |
| Ornith-1.5-35B-Q4_K_M.gguf | Q4_K_M | 消费级硬件、追求最低显存 |
另有 mmproj-Ornith-1.5-35B-BF16.gguf 多模态投影文件,可用于视觉能力场景。
三步本地跑起来(llama.cpp):
- 从本仓库下载对应量化文件(clone 仓库:
git clone https://gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF) - 用
llama-server起一个 OpenAI 兼容接口,加载 GGUF 文件并设置 256K 上下文 - 任何支持自定义 endpoint 的工具(Coding CLI、Agent 框架)把
OPENAI_BASE_URL指过来即可
Ollama 用户更简单,一条命令:
ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF上手建议:推理参数与长上下文设置 ✅
这个模型是推理模型:默认会在正式回答前输出一段<think>…</think>思考过程,部署时需要开启 reasoning parser 与 tool-call parser(如 vLLM 加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_xml),否则思考链和工具调用不会正确分离到reasoning_content/tool_calls字段。
采样参数建议(来自 README.md 官方推荐):
- 日常使用:
temperature=0.6、top_p=0.95、top_k=20 - 复现基准成绩:
temperature=1.0 - 长上下文:原生支持 256K(262,144 tokens);任务超长时可启用 YaRN RoPE scaling 扩展到约 1M tokens——注意只有真的需要长窗口才开,避免影响普通长度的输出质量
结语:3B 激活参数,跑出大模型的成绩
回到开头的两个数字:SWE-bench Verified 79、Terminal-Bench 2.1 约 68。对一个小体量 MoE 模型来说,这组分数意味着它不是"会聊代码的聊天机器人",而是能独立修 Issue、自主操作终端的可用型编程智能体。
如果你是本地算力党,建议从 Q6_K 或 Q8_0 版本入手,在 llama.cpp / Ollama 里体验一把;如果你关注它的技术路线,README.md 里引用的 Ornith-1.5 官方博客值得细读——"自我改进闭环"可能是中小参数模型持续变强的关键路径。
【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考