news 2026/8/27 17:50:35

深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解

深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解

【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B

Ornith-1.5-397B 是 ornith-ai 发布的 397B 参数开源 MoE 大模型,官方跑分在Terminal-Bench 2.1 拿到 86.1、SWE-bench Verified 拿到 86。这两个分数是怎么测出来的?用了什么框架、什么采样参数、做了哪些防作弊处理?本文逐条拆解评测方法,帮你看懂这份跑分单的真实含金量。📊

397B MoE 大模型速览:先看模型本体

在解读跑分前,先明确"被测对象"是谁:

关键参数数值说明
架构混合专家(MoE)512 个专家,每 token 激活 10 个
总参数量约 397Bbf16 权重大小约 807 GB
上下文窗口262,144 tokens支持 YaRN 扩展至约 1M
层数60 层每 4 层穿插一次全注意力
模型类型推理模型输出前会先产生think思考块

几个对跑分有直接影响的设定:

  • 它是推理模型:默认先输出思考内容再给答案,评测框架需要专门的 reasoning 解析器才能正确计分。
  • 工具调用原生支持:模型会输出规范的工具调用块,服务侧可解析为标准tool_calls——这正是它擅长 Agent 类编码任务的底层原因。
  • 权重文件:模型拆分为 122 个 safetensors 分片(model-00001-of-00122.safetensorsmodel-00122-of-00122.safetensors),另有独立的model-mtp.safetensors多 token 预测权重。
  • 架构与结构参数可在仓库的config.json中逐项查证,采样默认值见generation_config.json

Terminal-Bench 86.1 跑分是怎么测出来的

Terminal-Bench 2.1 考察模型在真实终端环境里完成系统工程任务的能力,是衡量"Agent 型编码能力"的核心基准。Ornith-1.5-397B 在这个基准上提供了两组分数:

  • Terminus-2 框架下:86.1(主打分数)
  • Claude Code 框架下:85.2

官方给出的 Terminus-2 版评测细节如下,每一条都值得注意:

  1. 框架与参数:使用 Harbor/Terminus-2 框架,parser=json,temperature=1.0,top_p=1.0,128K 上下文窗口。
  2. 硬件与超时:每次运行 4 小时超时,32 CPU 核、48GB 内存的沙箱环境——这是跑分"可复现性"的关键。
  3. 多次取平均:所有结果均为5 次独立运行的平均值,单次波动被抹平。
  4. 训练-推理一致性:团队专门调整了 Qwen 系 chat 模板(见仓库内chat_template.jinja),确保评测时的提示格式与训练阶段一致,避免模板漂移压低分数。
  5. 框架适配:修改了 Harbor 框架以对齐 vLLM 的reasoning_content字段,保证思考块不会被误判为正文。

💡 划重点:86.1 不是单次跑出来的,而是 5 次平均;且 temperature=1.0 是"复现跑分"的设定,与日常使用建议的 0.6 不同。

SWE-bench Verified 86:评测配置与防作弊机制

SWE-bench Verified 考察模型解决真实 GitHub 仓库中开源项目 issue 的能力,是目前"修 Bug 能力"的事实标准。Ornith-1.5-397B 在此项得分为86,同套配置下 SWE-bench Pro 65.1、SWE-bench Multilingual 79.6。

评测方法上有两个关键点:

① 统一 Harness 与参数

  • 使用 OpenHands 作为 Agent 框架,temperature=1.0,top_p=0.95,256K 上下文窗口。
  • 与 Terminal-Bench 一样,同样取 5 次运行平均值。

② 双重防作弊(anti-hacking)设计⚠️

  • 删除 Git 历史:评测用仓库镜像中抹掉了 git 历史,模型无法从历史提交中"偷看"标准答案;
  • 断网运行:评测环境禁用网络访问,模型无法检索外部资料或搜索答案。

这两条措施直接排除了"靠搜索和翻历史提交刷分"的可能,让 86 这个分数更接近模型真实的代码修复能力。同类防作弊思想也贯穿了其他评测,例如 NL2Repo 评测中屏蔽了指定 GitHub 仓库与 pip 包的访问。

完整跑分对比:一次看懂各维度得分

以下是官方模型卡中的核心跑分(Ornith-1.5 均为 5 次运行平均):

评测基准Ornith-1.5-397BDeepSeek-V4-Flash-0731GLM-5.2Claude Opus 4.8Kimi K3
Terminal-Bench 2.1 (Terminus-2)86.182.781.085.088.3
Terminal-Bench 2.1 (Claude Code)85.281.882.778.9-
SWE-bench Verified8681.683.085.886.2
SWE-bench Pro65.164.462.168.0-
DeepSWE56.054.446.259.067.5
HLE (带工具)56.150.854.757.956.0
GPQA Diamond92.891.491.293.693.5
MCP-Atlas80.074.677.882.282.3
BrowseComp86.684.885.684.391.2

如何解读这张表:

  • 编码与终端任务:与 Claude Opus 4.8(85.0 / 59.0)基本持平,明显领先同量级开源模型 GLM-5.2 与 DeepSeek-V4-Flash-0731。
  • 推理能力:GPQA Diamond 92.8,与顶级闭源模型差距很小;HLE 无工具 44.6 / 带工具 56.1,用 Claude 4.6 Opus 担任评审模型。
  • Agent 能力:MCP-Atlas 80.0(500 任务公开子集、thinking 模式、单任务 10 分钟超时、Claude 4.8 Opus 评审)、Toolathlon-Verified 71.2、WideSearch 80.8、ClawEval 81.4,整体处于第一梯队。
  • 短板:Frontier-Bench v0.1 仅 13.5,说明在极端难度的前沿任务上仍有提升空间,这一点解读跑分时不应忽略。

决定分数可信度的 5 个评测细节

新手看跑分最容易"只看数字",以下 5 个细节才是分数的可信度来源:

  1. 5 次独立运行取平均——所有 Ornith-1.5 报告值均如此,消除了单样本波动。
  2. 明确的温度与框架版本——如 Claude Code 组使用 Claude Code 2.1.126、max_new_tokens=131072,框架版本固定才能对比。
  3. 防奖励作弊(reward hacking)设计——删 git 历史、断网、屏蔽 pip 与指定仓库,堵死"抄答案"路径。
  4. 训练-推理模板对齐——评测前专门调整 chat 模板,分数反映的是模型本身而非格式红利。
  5. 统一的评审模型——HLE、MCP-Atlas 等主观/开放性任务均指定了固定的 Judge 模型,避免评审标准漂移。

看完跑分之后:如何部署与调用

分数之外,实际使用 Ornith-1.5-397B 还有几点实操建议:

  • 显存预算:bf16 权重约 800 GB,官方推荐单节点 8 卡张量并行(如 8× H200),小显存可换 FP8/INT4 量化版本。
  • 采样参数:日常任务建议 temperature=0.6、top_p=0.95、top_k=20;若要复现跑分则用 temperature=1.0——这正是"评测分数"与"日常体验"可能略有差异的原因之一。
  • 推理解析器:部署时需开启 reasoning parser 与 tool-call parser(vLLM/SGLang 均有对应参数),思考块会单独返回到reasoning_content字段。
  • 长上下文:原生 262K tokens,可用内置 YaRN(factor 4.0)扩展到约 1M,但静态缩放对普通长度请求略有损耗,按需开启。
  • Agent 框架:OpenCode、Ollama、llama.cpp 等 OpenAI 兼容端点均可直接接入,配合 Terminal-Bench 类终端 Agent 使用最能发挥其 86.1 的实力。

小结

Ornith-1.5-397B 的 Terminal-Bench 86.1 与 SWE-bench Verified 86,建立在5 次平均、固定框架版本、删 git 历史 + 断网防作弊、训练-推理模板对齐的严格评测流程之上,与 Claude Opus 4.8 基本持平、领先同量级开源模型,属于"有方法论支撑的分数"。如果你需要终端 Agent 或大规模修 Bug 场景的开源大模型,这份跑分单值得重点关注。🐦

【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 17:46:59

基于Dify本地部署Qwen3模型,打造AI医疗问诊初筛系统

前言本文通过在本地部署的Dify平台上结合最新的Qwen3模型构建本地化AI医疗问诊初筛系统,从模型特性、本地部署步骤到实际应用案例,为您提供全面的技术指南。你是否曾经为挂不到专家号而苦恼?或者在医院排长队只为了一个简单的问题咨询&#x…

作者头像 李华