使用真实项目+已有skill进行测试。
测试
| 组别 | 模型 | 思考程度 | 耗时 | 质量 |
|---|---|---|---|---|
| A 组:开了思考 | Muse Spark 1.3 | Xhigh | 1分54s | 7.5 |
| A 组:开了思考 | Space Bunny | Max | 5分35s | 9.5 |
| B 组:无思考开关 | LongCat 2.5 Preview | 不可选 | 4分18s | 5 |
| B 组:无思考开关 | MiMo-V2.6-Flash | 不可选 | 9分31s | 9 |
总结
| 模型 | 我的评估 | 社区共识 | 一致性 |
|---|---|---|---|
| LongCat 2.5 | 不合格(5/10) | 无基准、社区实测差、定位客服场景 | ✅ 高度一致 |
| MiMo-V2.6-Flash | 高质(9/10) | 智能领先但慢、冗长、开源强模型 | ✅ 高度一致 |
| Space Bunny | 最高分(9.5/10) | 速度极快、3D 强、但评价两极 | ✅ 一致(维度不同) |
| Muse Spark 1.3 | 中上(7.5/10) | 智能高、速度快、但冗长、定位效率 | ✅ 高度一致 |
需要修正的一点:MiMo-V2.6-Flash 并非“无推理能力”,而是用户无法在 OpenCode 中控制其推理强度。它本身是支持推理的模型,只是在当前界面下不可调。LongCat 是模型不支持,MiMo 是界面不支持调节,两者性质不同。
省流版
Space Bunny Max—— 最快达到最高质量
MiMo-V2.6-Flash—— 质量相当,但耗时
Big Pickle—— 替代使用