如何5分钟上手 NeoHorse-1-4B:从下载到第一次对话的完整教程
【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B
想快速跑通一个能"动手干活"的 AI 模型吗?NeoHorse-1-4B是一个约 40 亿参数的开源智能体(Agentic)大语言模型,专为工具调用、编程和指令遵循场景优化,由 TokenRhythm 基于 Qwen3.5-4B 微调而成。本教程带你从下载到发出第一条消息,全程约 5 分钟,不需要复杂环境配置。
先了解 NeoHorse-1-4B 是什么
在动手之前,花 30 秒认识一下这个模型 🐴:
| 属性 | 说明 |
|---|---|
| 模型类型 | 4B 智能体原生因果语言模型(纯文本输入/输出) |
| 基础模型 | Qwen3.5-4B(微调 + 重新打包,仅含语言模型权重) |
| 上下文长度 | 原生支持 262,144 tokens |
| 权重精度 | Safetensors / BF16 |
| 核心能力 | 智能体任务、工具使用、编程、推理、指令遵循 |
| 许可证 | Apache 2.0(可商用) |
它的亮点在于:在十个基准测试的宏平均得分上达到64.87,比基础模型 Qwen3.5-4B 高出+5.93分,尤其在智能体类任务(如 WorkBuddy Bench +9.79)和编程任务(如 HumanEval +9.75)上提升明显。
第一步:获取模型权重
从 GitCode 克隆模型仓库:
git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B💡 权重文件
model-00001-of-00002.safetensors和model-00002-of-00002.safetensors通过 Git LFS 分发,完整下载后合计约8 GB,请确保已安装 Git LFS(git lfs install)。
下载完成后,确认目录中包含这些关键文件:
| 文件 | 作用 |
|---|---|
| config.json | 模型配置:32 层、2560 隐藏维度、262144 上下文 |
| model.safetensors.index.json | 权重分片索引,共两个分片 |
| tokenizer.json、vocab.json、merges.txt | 词表与分词器 |
| chat_template.jinja | 对话模板(含工具调用格式定义) |
⚠️ 注意:该版本仅包含语言模型权重,不支持图片/视频输入。如果你的任务是纯文本的智能体或编程场景,正合适。
第二步:用 SGLang 启动推理服务(推荐)
官方技术报告使用的就是 SGLang,兼容性最有保障:
pip install "sglang==0.5.17" MODEL_PATH="/path/to/NeoHorse-1-4B" # 改成你的实际下载路径 python3 -m sglang.launch_server \ --model-path "$MODEL_PATH" \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder几个参数值得注意:
--served-model-name:后续请求时使用的模型名(如neohorse-1-4b),不是文件路径;--reasoning-parser qwen3:启用思考模式,让模型先推理再回答;--tool-call-parser qwen3_coder:启用工具调用解析,这是智能体能力的关键开关。
💡 显存不足时,可以调小
--context-length(如32768),上下文长度按 GPU 显存灵活调整。
没有 GPU 的读者可以先跳过本节,等硬件到位后再部署——4B 模型在单张消费级显卡上即可流畅运行。
第三步:发送第一次对话
服务启动后,打开另一个终端,发送一个 OpenAI 兼容请求试试 🎉:
curl http://localhost:30000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"neohorse-1-4b","messages":[{"role":"user","content":"写一个返回前 n 个斐波那契数的 Python 函数"}],"max_tokens":512}'如果返回了一段可运行的 Python 代码,恭喜,你的 NeoHorse-1-4B 已经跑起来了!
备选方案:用 vLLM 部署
如果你更熟悉 vLLM,它同样支持(同样暴露 OpenAI 兼容接口):
pip install -U vllm vllm serve "$MODEL_PATH" \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 8000 \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder注意请求地址变为http://localhost:8000/v1/chat/completions,其余用法完全一致。
常见问题速查(FAQ)
Q1:为什么提示找不到权重文件?检查克隆目录里的*.safetensors文件大小。如果只有几 KB,说明 LFS 未生效,执行git lfs install && git lfs pull重新拉取。
Q2:请求中 model 字段该填什么?填服务启动时指定的名字neohorse-1-4b,而不是本地路径。
Q3:能接入 OpenAI SDK / LangChain 等框架吗?可以。服务暴露的是标准 OpenAI 兼容接口,把 API base 指向http://localhost:30000/v1即可。
Q4:支持多轮对话吗?支持,按标准 chat 格式在messages里追加历史消息即可,模型自带的对话模板(chat_template.jinja)会自动处理格式。
Q5:可以商用吗?可以,模型采用 Apache 2.0 许可证。
总结
整个流程回顾:
- ⬇️
git clone拉取仓库(约 8 GB,注意 LFS) - 🚀
pip install sglang==0.5.17并启动服务 - 💬 发一条 chat 请求,拿到模型的回答
NeoHorse-1-4B 作为通往"递归自我改进"(RSI)的初步原型,最大的价值在于智能体任务 + 工具调用的均衡能力。如果你想深入了解其路由引导的智能体后训练方法,可以参考仓库说明 README.md 中提到的技术报告。现在,去发出你的第一条消息吧!
【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考