深度解读 Ornith-1.5-397B 跑分:Terminal-Bench 86.1 与 SWE-bench 86 评测方法全拆解
【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B
Ornith-1.5-397B 是 ornith-ai 发布的 397B 参数开源 MoE 大模型,官方跑分在Terminal-Bench 2.1 拿到 86.1、SWE-bench Verified 拿到 86。这两个分数是怎么测出来的?用了什么框架、什么采样参数、做了哪些防作弊处理?本文逐条拆解评测方法,帮你看懂这份跑分单的真实含金量。📊
397B MoE 大模型速览:先看模型本体
在解读跑分前,先明确"被测对象"是谁:
| 关键参数 | 数值 | 说明 |
|---|---|---|
| 架构 | 混合专家(MoE) | 512 个专家,每 token 激活 10 个 |
| 总参数量 | 约 397B | bf16 权重大小约 807 GB |
| 上下文窗口 | 262,144 tokens | 支持 YaRN 扩展至约 1M |
| 层数 | 60 层 | 每 4 层穿插一次全注意力 |
| 模型类型 | 推理模型 | 输出前会先产生think思考块 |
几个对跑分有直接影响的设定:
- 它是推理模型:默认先输出思考内容再给答案,评测框架需要专门的 reasoning 解析器才能正确计分。
- 工具调用原生支持:模型会输出规范的工具调用块,服务侧可解析为标准
tool_calls——这正是它擅长 Agent 类编码任务的底层原因。 - 权重文件:模型拆分为 122 个 safetensors 分片(
model-00001-of-00122.safetensors至model-00122-of-00122.safetensors),另有独立的model-mtp.safetensors多 token 预测权重。 - 架构与结构参数可在仓库的
config.json中逐项查证,采样默认值见generation_config.json。
Terminal-Bench 86.1 跑分是怎么测出来的
Terminal-Bench 2.1 考察模型在真实终端环境里完成系统工程任务的能力,是衡量"Agent 型编码能力"的核心基准。Ornith-1.5-397B 在这个基准上提供了两组分数:
- Terminus-2 框架下:86.1(主打分数)
- Claude Code 框架下:85.2
官方给出的 Terminus-2 版评测细节如下,每一条都值得注意:
- 框架与参数:使用 Harbor/Terminus-2 框架,
parser=json,temperature=1.0,top_p=1.0,128K 上下文窗口。 - 硬件与超时:每次运行 4 小时超时,32 CPU 核、48GB 内存的沙箱环境——这是跑分"可复现性"的关键。
- 多次取平均:所有结果均为5 次独立运行的平均值,单次波动被抹平。
- 训练-推理一致性:团队专门调整了 Qwen 系 chat 模板(见仓库内
chat_template.jinja),确保评测时的提示格式与训练阶段一致,避免模板漂移压低分数。 - 框架适配:修改了 Harbor 框架以对齐 vLLM 的
reasoning_content字段,保证思考块不会被误判为正文。
💡 划重点:86.1 不是单次跑出来的,而是 5 次平均;且 temperature=1.0 是"复现跑分"的设定,与日常使用建议的 0.6 不同。
SWE-bench Verified 86:评测配置与防作弊机制
SWE-bench Verified 考察模型解决真实 GitHub 仓库中开源项目 issue 的能力,是目前"修 Bug 能力"的事实标准。Ornith-1.5-397B 在此项得分为86,同套配置下 SWE-bench Pro 65.1、SWE-bench Multilingual 79.6。
评测方法上有两个关键点:
① 统一 Harness 与参数
- 使用 OpenHands 作为 Agent 框架,temperature=1.0,top_p=0.95,256K 上下文窗口。
- 与 Terminal-Bench 一样,同样取 5 次运行平均值。
② 双重防作弊(anti-hacking)设计⚠️
- 删除 Git 历史:评测用仓库镜像中抹掉了 git 历史,模型无法从历史提交中"偷看"标准答案;
- 断网运行:评测环境禁用网络访问,模型无法检索外部资料或搜索答案。
这两条措施直接排除了"靠搜索和翻历史提交刷分"的可能,让 86 这个分数更接近模型真实的代码修复能力。同类防作弊思想也贯穿了其他评测,例如 NL2Repo 评测中屏蔽了指定 GitHub 仓库与 pip 包的访问。
完整跑分对比:一次看懂各维度得分
以下是官方模型卡中的核心跑分(Ornith-1.5 均为 5 次运行平均):
| 评测基准 | Ornith-1.5-397B | DeepSeek-V4-Flash-0731 | GLM-5.2 | Claude Opus 4.8 | Kimi K3 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 (Terminus-2) | 86.1 | 82.7 | 81.0 | 85.0 | 88.3 |
| Terminal-Bench 2.1 (Claude Code) | 85.2 | 81.8 | 82.7 | 78.9 | - |
| SWE-bench Verified | 86 | 81.6 | 83.0 | 85.8 | 86.2 |
| SWE-bench Pro | 65.1 | 64.4 | 62.1 | 68.0 | - |
| DeepSWE | 56.0 | 54.4 | 46.2 | 59.0 | 67.5 |
| HLE (带工具) | 56.1 | 50.8 | 54.7 | 57.9 | 56.0 |
| GPQA Diamond | 92.8 | 91.4 | 91.2 | 93.6 | 93.5 |
| MCP-Atlas | 80.0 | 74.6 | 77.8 | 82.2 | 82.3 |
| BrowseComp | 86.6 | 84.8 | 85.6 | 84.3 | 91.2 |
如何解读这张表:
- 编码与终端任务:与 Claude Opus 4.8(85.0 / 59.0)基本持平,明显领先同量级开源模型 GLM-5.2 与 DeepSeek-V4-Flash-0731。
- 推理能力:GPQA Diamond 92.8,与顶级闭源模型差距很小;HLE 无工具 44.6 / 带工具 56.1,用 Claude 4.6 Opus 担任评审模型。
- Agent 能力:MCP-Atlas 80.0(500 任务公开子集、thinking 模式、单任务 10 分钟超时、Claude 4.8 Opus 评审)、Toolathlon-Verified 71.2、WideSearch 80.8、ClawEval 81.4,整体处于第一梯队。
- 短板:Frontier-Bench v0.1 仅 13.5,说明在极端难度的前沿任务上仍有提升空间,这一点解读跑分时不应忽略。
决定分数可信度的 5 个评测细节
新手看跑分最容易"只看数字",以下 5 个细节才是分数的可信度来源:
- 5 次独立运行取平均——所有 Ornith-1.5 报告值均如此,消除了单样本波动。
- 明确的温度与框架版本——如 Claude Code 组使用 Claude Code 2.1.126、max_new_tokens=131072,框架版本固定才能对比。
- 防奖励作弊(reward hacking)设计——删 git 历史、断网、屏蔽 pip 与指定仓库,堵死"抄答案"路径。
- 训练-推理模板对齐——评测前专门调整 chat 模板,分数反映的是模型本身而非格式红利。
- 统一的评审模型——HLE、MCP-Atlas 等主观/开放性任务均指定了固定的 Judge 模型,避免评审标准漂移。
看完跑分之后:如何部署与调用
分数之外,实际使用 Ornith-1.5-397B 还有几点实操建议:
- 显存预算:bf16 权重约 800 GB,官方推荐单节点 8 卡张量并行(如 8× H200),小显存可换 FP8/INT4 量化版本。
- 采样参数:日常任务建议 temperature=0.6、top_p=0.95、top_k=20;若要复现跑分则用 temperature=1.0——这正是"评测分数"与"日常体验"可能略有差异的原因之一。
- 推理解析器:部署时需开启 reasoning parser 与 tool-call parser(vLLM/SGLang 均有对应参数),思考块会单独返回到
reasoning_content字段。 - 长上下文:原生 262K tokens,可用内置 YaRN(factor 4.0)扩展到约 1M,但静态缩放对普通长度请求略有损耗,按需开启。
- Agent 框架:OpenCode、Ollama、llama.cpp 等 OpenAI 兼容端点均可直接接入,配合 Terminal-Bench 类终端 Agent 使用最能发挥其 86.1 的实力。
小结
Ornith-1.5-397B 的 Terminal-Bench 86.1 与 SWE-bench Verified 86,建立在5 次平均、固定框架版本、删 git 历史 + 断网防作弊、训练-推理模板对齐的严格评测流程之上,与 Claude Opus 4.8 基本持平、领先同量级开源模型,属于"有方法论支撑的分数"。如果你需要终端 Agent 或大规模修 Bug 场景的开源大模型,这份跑分单值得重点关注。🐦
【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考