- 大模型
- 基础模型
- 多模态
- AI Agent
- 计算机视觉
【免费下载链接】Nex-N2.5-Pro
本文基于 Nex-N2.5 模型家族官方发布说明与开源仓库,系统讲解以Nex-N2.5-Pro为代表的 Agentic 模型如何通过定制 SGLang 镜像完成本地/多卡部署、如何配置采样参数与思维模式、如何开启函数调用与推理解析,并结合仓库内的 config.json、chat_template.jinja 等文件深入解析底层实现。读完本文,你将能够独立完成 Nex-N2.5 三档模型的 Docker 启动、OpenAI 兼容接口调用,以及面向"电脑操控 + 网页浏览 + 视觉反馈自校正"的长程 Agent 任务的工程配置。
一、Nex-N2.5 是什么:面向真实环境长程任务的 Agentic 模型家族
Nex-N2.5 是 Nex-AGI 推出的下一代 Agentic 模型家族,定位是"为真实世界环境中的长程任务(long-horizon tasks)而构建"。官方发布口径中,这一代模型强化了持续行动 + 通过视觉反馈自我校正的能力——模型可以直接操作电脑与浏览器,也能自主执行并测试程序。在这个体系里,视觉不再只是一个输入模态,而是 Agent感知环境、验证结果、推进任务的关键接口。
Nex-N2.5 共分三个尺寸档位,本仓库镜像对应其中的Pro档:
| 档位 | 定位 |
|---|---|
| Nex-N2.5-mini | 轻量档,延续 Nex-N2 的多模态基础,聚焦 computer use、web browsing 与视觉 grounding 的 Agent 能力,适合单卡/双卡部署 |
| Nex-N2.5-Pro | 主力档(本仓库),同样基于 Nex-N2 的多模态基础做定向增强,平衡性能与部署成本 |
| Nex-N2.5-Max | 旗舰档,构建于 1.6 万亿参数的纯文本 Mixture-of-Experts(MoE)基座之上,是首次在万亿参数规模完成系统化后训练的产物 |
在训练维度,官方还强调这一代扩大了 Agent 训练环境、任务类型与生产力场景的范围,并在更大模型中积累了 Agentic 能力训练的实际经验。模型权重将以开源形式发布,同时提供托管在线服务。
二、开源仓库组成与权重获取
本仓库是Nex-N2.5-Pro的开源镜像,根目录下包含推理与部署所需的全部配置文件:
| 文件 | 作用 |
|---|---|
| config.json | 模型架构与量化配置(qwen3_5_moe) |
| chat_template.jinja | 官方 Chat 模板,内置思维模式、工具调用、图文/视频占位处理 |
| tokenizer_config.json | 分词器配置(Qwen2Tokenizer,model_max_length262144) |
| tokenizer.json | 分词器词表文件 |
| processor_config.json | 多模态 Processor(Qwen3VLProcessor,图像 + 视频预处理) |
| preprocessor_config.json | 图像预处理器参数 |
model-00001-of-00122.safetensors~model-00122-of-00122.safetensors | 122 个权重分片 |
| model.safetensors.index.json | 权重分片索引(经 Git LFS 管理) |
| figures/Nex-N2.5-Benchmark-white.png | 官方 Benchmark 总览图 |
需要特别说明的是:仓库中的*.safetensors权重文件以Git LFS 指针形式存储(本地文件仅 100 余字节,内容为version https://git-lfs.github.com/spec/v1头部),因此通过git clone拉取仓库后,还需执行git lfs pull才能将真实权重下载到本地。获取权重后,即可按下文方式部署。
三、架构速览:从 config.json 看 Nex-N2.5-Pro 的实现
尽管 README 聚焦使用层面,但仓库内的 config.json 提供了充分的架构证据,能帮助我们理解部署参数为何如此设置。
3.1 模型基座与总体结构
- 架构:
Qwen3_5MoeForConditionalGeneration,model_type为qwen3_5_moe; - 精度:默认
bfloat16(dtype: "bfloat16"); - 上下文长度:
max_position_embeddings: 262144,与 tokenizer_config.json 中的model_max_length: 262144一致——这也是部署命令中--context-length 262144的由来; - 词表:
vocab_size: 248320,eos_token_id: 248044。
3.2 混合注意力:线性注意力 + 全注意力
text_config.layer_types列出的 60 层中,绝大多数为linear_attention,并每隔 4 层插入一层full_attention(full_attention_interval: 4)。这种线性注意力与全注意力混合的布局是长上下文场景下控制 KV 开销的关键——线性注意力层不随序列长度线性增长缓存,全注意力层则保留关键位置的精确检索能力。配套参数包括:
linear_key_head_dim: 128、linear_num_key_heads: 16linear_value_head_dim: 128、linear_num_value_heads: 64linear_conv_kernel_dim: 4、mamba_ssm_dtype: "float32"head_dim: 256、num_attention_heads: 32、num_key_value_heads: 2
这也解释了 README 部署命令中--mamba-scheduler-strategy extra_buffer这一调度参数的存在意义。
3.3 MoE 配置
num_experts: 512,num_experts_per_tok: 10(每 token 激活 10 个专家);shared_expert_intermediate_size: 1024、moe_intermediate_size: 1024;router_aux_loss_coef: 0.001,output_router_logits: false。
大专家数 + 稀疏激活是万亿参数 MoE 的典型形态,部署时通过--ep-size(专家并行)与--moe-a2a-backend deepep等参数进行并行化。
3.4 FP8 块量化
quantization_config采用compressed-tensors(quant_method: "compressed-tensors",状态compressed),配置了名为FP8_BLOCK的量化组:
- 权重:8 bit、
strategy: "block"、block_structure: [128, 128]、对称、observer: "memoryless_minmax"; - 输入激活:8 bit、
strategy: "group"、group_size: 128、动态量化(dynamic: true)。
同时通过ignore规则排除了一部分敏感层(re:.*visual.*、re:.*embed_tokens.*、re:.*lm_head.*、re:.*mlp\.gate$、re:.*linear_attn\.conv1d$等),保证视觉塔、词嵌入与门控路由保持更高精度。
3.5 多模态视觉塔
vision_config表明其视觉编码器延续 Qwen3VL 风格:patch 16、temporal patch 2、27 层深度、hidden_size: 1152、out_hidden_size: 4096(对齐语言侧 hidden size)、spatial_merge_size: 2,并支持视频输入(temporal_patch_size: 2)。语言侧同时存在image_token_id: 248056、video_token_id: 248057与vision_start/end_token_id,与 processor_config.json 中Qwen3VLProcessor的图像/视频双路预处理(视频默认fps: 2、max_frames: 768、min_frames: 4)构成完整的多模态链路。
四、性能表现:官方评测概览
官方在 coding、agentic workflows、computer use、multimodal understanding 四类场景下对mini / Pro / Max三档模型进行了评测。以下为 README 公布的完整结果(加粗为各基准最佳成绩,含并列;—表示数据不可用)。
4.1 文本基准(Text Benchmarks)
| Benchmark | Nex-N2.5-mini | Nex-N2.5-Pro | Nex-N2.5-Max | Claude Opus 5 | GPT-5.6 Sol | Kimi-K3 | GLM-5.3 | DeepSeek-V4-Pro-0813 | Qwen3.8-Max |
|---|---|---|---|---|---|---|---|---|---|
| CODING | |||||||||
| Terminal-Bench 2.1 | 73.4 | 82.7 | 86.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 86.6 |
| SWE-Bench Pro | 43.8 | 61.2 | 65.7 | 79.2 | 64.6 | 63.3 | 64.6 | 55.4 | 67.7 |
| DeepSWE v1.1 | 36.1 | 55.8 | 65.6 | 73.7 | 72.7 | 67.5 | 66.9 | 62.8 | 69.3 |
| AGENTIC | |||||||||
| AutomationBench v1.0.6 | 32.3 | 44.2 | 50.2 | 50.3 | 45.8 | 46.7 | 48.2 | 43.2 | 39.8 |
| Toolathlon Verified | 54.6 | 68.5 | 74.7 | 76.5 | 74.9 | 76.5 | 73.0 | 74.1 | 72.5 |
| GDPval-AA v2 | 1446 | 1628 | 1713 | 1831 | 1711 | 1675 | 1763 | 1580 | 1717 |
| Job Bench | 28.5 | 41.4 | 53.6 | 65.7 | 45.4 | 52.9 | 58.2 | 54.1 | 53.4 |
| BrowseComp | 83.4 | 89.7 | 92.6 | 90.8 | 90.4 | 91.2 | — | — | — |
4.2 多模态基准(Multimodal Benchmarks)
| Benchmark | Nex-N2.5-mini | Nex-N2.5-Pro | MiniMax-M3 | Claude Opus 5 | GPT-5.6 Sol | Kimi-K3 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision | Qwen3.8-Max |
|---|---|---|---|---|---|---|---|---|---|
| OSWorld-Verified | 71.2 | 82.2 | 75.2 | 83.4 | 83.2 | 84.8 | 62.3 | 76.7 | 86.1 |
| OSWorld-2 | 30.5 | 56.4 | 22.3 | 68.3 | 62.7 | 58.3 | — | — | 46.7 |
| WebTest | 48.6 | 52.8 | — | — | 54.0 | — | — | — | 52.3 |
| WebArena-Verified | 63.4 | 67.6 | — | — | 69.7 | 71.6 | — | 62.3 | 66.8 |
| OSWorld-G | 82.9 | 87.4 | — | 76.8 | 77.7 | 79.6 | 83.3 | 59.4 | 84.9 |
| Vision2Web | 52.9 | 68.2 | 59.0 | — | 79.8 | — | — | — | 75.1 |
| SWE-MM | 25.5 | 38.2 | — | 59.4 | 40.2 | 37.3 | 20.6 | 39.2 | 39.2 |
| OmniDoc | 89.7 | 92.2 | 91.6 | — | 92.9 | — | — | — | 92.1 |
评测方法脚注(官方口径):
- 分数来源:凡有公开来源的分数取自官方 Benchmark 榜单及模型厂商最新评测报告(包括 Kimi-K3、Qwen3.8-Max、GLM-5.3、HY4 报告);无公开来源的结果由官方自评获得。
- 采样参数:官方评测统一使用
temperature = 0.7、top_p = 0.95、top_k = 40。 - 评测框架:Coding 类任务使用 NexAU 框架评测。
- DeepSeek-V4-Pro:评测使用 DeepSeek-V4-Pro-0813 版本。
- AutomationBench:使用 Public 版本。
- BrowseComp:当 token 用量超过模型上下文窗口的 60% 时,采用 Summary context-compaction 策略。
- Vision2Web:报告的是 Frontend、Webpage、Website 三个类别的平均分,使用 Gemini-3.5-Flash 作为 VLM 裁判、GLM-5V-Turbo (Claude Code) 作为 GUI Agent。
- Computer-use / browser-use 基准(OSWorld、WebTest、WebArena)使用官方 NexCUA 评测框架,grounding 坐标归一化到 0–1000 尺度;NexCUA 项目即将开源。
- WebTestBench:以oracle mode评测,仅用 ground-truth 清单评估缺陷检测能力,不包含清单生成环节。
- 记法:加粗为最佳成绩(含并列),
—表示数据不可用。
五、Docker 部署:基于定制 SGLang 的一键启动
官方提供预构建 Docker 镜像nexagi/sglang:v0.5.18-nex-patch,其中预装了经过定制修改的sglang分支,可直接承载 Nex-N2.5 全系模型。启动命令的核心是python3 -m sglang.launch_server加一系列模型相关参数。
5.1 Nex-N2.5-Pro:单节点 8 × H100
docker run --gpus all --shm-size 32g --ipc=host \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 8 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-Pro/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer要点说明:
--gpus all --shm-size 32g --ipc=host:暴露全部 GPU、放大共享内存并共享主机 IPC 命名空间,是 SGLang 多卡推理的常规要求;-v /path/to/your/model:/model将权重目录挂载进容器,--model-path /model指向容器内路径;--tp 8:8 卡张量并行;--reasoning-parser qwen3:将模型的思考轨迹与最终回答分离(详见下文);--tool-call-parser qwen3_coder:开启函数调用解析;--chat-template指定本仓库根目录下的 chat_template.jinja;--mamba-scheduler-strategy extra_buffer:为线性注意力/Mamba 风格层预留额外缓冲,这是混合注意力模型特有的调度参数。
5.2 Nex-N2.5-mini:单节点 2 × H100
docker run --gpus all --shm-size 32g --ipc=host \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 2 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-mini/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer5.3 Nex-N2.5-Max:多节点 16 × H200
Max 档需2 个节点共 16 块 H200,且每个节点上运行同一条命令,通过环境变量区分角色:
<node-rank>:主节点填0,另一节点填1;<node0-ip>:主节点 IP(其余节点必须可达)。
docker run --gpus all --shm-size 32g --network host \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /path/to/your/model \ --trust-remote-code \ --host 0.0.0.0 \ --port 8000 \ --nnodes 2 \ --node-rank "${NODE_RANK}" \ --dist-init-addr "${MASTER_ADDR}:5000" \ --tp 16 \ --pp-size 1 \ --dp 1 \ --ep-size 16 \ --attention-backend dsv4 \ --kv-cache-dtype fp8_e4m3 \ --page-size 256 \ --moe-a2a-backend deepep \ --moe-runner-backend deep_gemm \ --moe-dense-tp-size 1 \ --deepep-mode auto \ --context-length 262144 \ --mem-fraction-static 0.84 \ --chunked-prefill-size 8192 \ --enable-mixed-chunk \ --disable-overlap-schedule \ --max-running-requests 64 \ --cuda-graph-max-bs-decode 64 \ --cuda-graph-backend-decode full \ --cuda-graph-backend-prefill disabled \ --chat-template /path/to/nex-n2.5-max/chat_template.jinja \ --reasoning-parser deepseek-r1 \ --tool-call-parser qwen3_coder5.4 Max 档关键参数解读
| 参数 | 取值 | 作用 |
|---|---|---|
--nnodes 2 --node-rank ${NODE_RANK} | 2 / 0 或 1 | 双节点并行,每节点按 rank 分工 |
--dist-init-addr "${MASTER_ADDR}:5000" | 主节点 IP:端口 | 分布式初始化地址 |
--tp 16 --pp-size 1 --dp 1 --ep-size 16 | 16/1/1/16 | 张量并行 16、不做流水与数据并行、专家并行 16(契合 512 专家 × 每 token 10 专家激活的 MoE 结构) |
--attention-backend dsv4 | dsv4 | 指定注意力后端实现 |
--kv-cache-dtype fp8_e4m3 | fp8_e4m3 | KV 缓存使用 FP8,显著降低长上下文显存占用 |
--page-size 256 | 256 | 分页缓存页大小 |
--moe-a2a-backend deepep --moe-runner-backend deep_gemm | deepep / deep_gemm | MoE All-to-All 通信与算子后端,配合--deepep-mode auto |
--moe-dense-tp-size 1 | 1 | 稠密专家部分的张量并行度 |
--context-length 262144 | 262144 | 与模型max_position_embeddings对齐 |
--mem-fraction-static 0.84 | 0.84 | 预分配显存比例 |
--chunked-prefill-size 8192 --enable-mixed-chunk | 8192 | 分块 Prefill 与混合分块,降低长序列首字延迟 |
--disable-overlap-schedule | — | 关闭调度重叠(配合 deep_gemm 后端) |
--max-running-requests 64 | 64 | 最大并发请求数 |
--cuda-graph-max-bs-decode 64 | 64 | Decode 阶段 CUDA Graph 最大 batch |
--cuda-graph-backend-decode full | full | Decode 全量 CUDA Graph |
--cuda-graph-backend-prefill disabled | disabled | Prefill 阶段不启用 CUDA Graph |
--trust-remote-code | — | 信任远端代码(加载含自定义代码的模型) |
六、推荐采样参数
为获得最佳生成质量,官方推荐的采样参数为:
temperature:0.7top_p:0.95top_k:40
这也与官方评测所用的采样设置一致(见上文脚注 2),可作为接入服务时的默认值。
七、思维模式控制:reasoning_effort
Nex-N2.5 通过请求中的reasoning_effort字段控制思考行为,共有三种模式:
reasoning_effort | 模式 | 行为 |
|---|---|---|
"none" | Non-thinking | 不输出思考轨迹,直接回答 |
"medium"(默认) | Adaptive thinking | 让模型自行决定是否思考以及思考多少 |
"high" | Thinking | 回答前总是先思考 |
以"自适应思考"为例,在 OpenAI 兼容的 Chat Completions 请求中这样设置(<served-model-name>替换为你的服务暴露的模型名):
{ "model": "<served-model-name>", "messages": [ {"role": "user", "content": "Explain how binary search works."} ], "reasoning_effort": "medium" }模板层实现佐证:查看仓库内的 chat_template.jinja 末尾(add_generation_prompt分支,约 L143–L153),可以看到reasoning_effort如何被消费:
- 未定义或为
none时输出<think>\n\n</think>\n\n(空思考块,等价于关闭思考); - 为
high时输出<think>\n(强制开启思考轨迹); - 其余情况(含默认)输出
<think>,交由模型自适应决定是否继续思考。
需要注意的是:Nex-N2.5 的 Chat 模板直接消费reasoning_effort;而诸如enable_thinking、thinking_mode这类字段需要在网关层做语义翻译后才能生效。
八、函数调用(Function Calling)
Nex 系列模型具备完善的函数调用能力。启动服务时加入--tool-call-parser qwen3_coder即可启用:
python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coderchat_template.jinja 中对工具调用有完整的内建支持,可从模板代码中看到三个关键机制:
- 工具注入:当请求携带
tools列表时,模板自动构造# Tools系统消息,将每个工具的 JSON Schema(tool | tojson)以<tools>...</tools>形式注入(约 L45–L53); - 调用格式约束:模板向模型声明严格的 XML 调用格式——外层
<tool_call></tool_call>嵌套<function=函数名></function>,参数以<parameter=参数名>值</parameter>逐条给出,并要求"必要参数必须填写、可在调用前给出自然语言推理、但调用后不得再补充说明"(约 L53); - 多轮工具结果回填:模板会从消息尾部反向扫描用户消息,识别被
<tool_response>...</tool_response>包裹的工具返回内容,并在渲染时将连续的tool角色消息合并进同一段user消息,从而支撑多步工具调用循环(约 L67–L80、L127–L138)。
此外,模板对多模态内容也有处理:图片与视频分别以<|vision_start|><|image_pad|><|vision_end|>、<|vision_start|><|video_pad|><|vision_end|>占位符注入(约 L8–L29),并支持Picture N:/Video N:编号提示;同时会显式拒绝系统消息中包含图片/视频(raise_exception('System message cannot contain images.'))。
九、推理解析器(Reasoning Parser)
当模型输出思考轨迹(reasoning trace)时,需要通过 SGLang 的 reasoning parser 将思考内容与最终回答分离:
- Nex-N2.5-mini 与 Nex-N2.5-Pro:
--reasoning-parser qwen3 - Nex-N2.5-Max:
--reasoning-parser deepseek-r1
上面的部署命令已包含正确的 parser 与--tool-call-parser qwen3_coder。Parser 负责从流式输出中剥离<think>...</think>之间的推理内容;而是否思考、思考多深,则由上一节的reasoning_effort决定。两者配合,即可获得"思考轨迹与工具调用均可解析"的结构化输出。
十、接入与验证建议
部署完成后,可通过 OpenAI 兼容接口向http://<host>:<port>/v1/chat/completions发起请求,model字段填写服务暴露的<served-model-name>(可用GET /v1/models查询)。一个完整的调用建议:
- 将
temperature、top_p、top_k设为官方推荐值(0.7 / 0.95 / 40); - 按任务类型设置
reasoning_effort(日常问答用默认medium,追求稳定思考用high,低延迟场景用none); - 涉及工具/浏览器/电脑操作时,确保服务启动命令带
--tool-call-parser qwen3_coder; - 长上下文场景确认服务侧
--context-length与模型 262144 对齐,并关注官方 BrowseComp 评测中提到的"token 用量超过上下文 60% 时启用摘要压缩"这一实践。
注意事项:本仓库为只读开源镜像,部署前请确认已通过git lfs pull获取完整权重;--chat-template指向的是各模型对应的 chat_template.jinja(本文仓库根目录即 Pro 版模板)。若需对照更多实现细节,可在仓库中继续查阅 config.json、tokenizer_config.json、processor_config.json 与 preprocessor_config.json。
- 大模型
- 基础模型
- 多模态
- AI Agent
- 计算机视觉
【免费下载链接】Nex-N2.5-Pro
相关推荐
Nex-N2.5-mini本地部署完整教程:Docker+SGLang一键启动,2张H100就够了
Nex N2.5 mini本地部署完整教程:Docker+SGLang一键启动,2张H100就够了 Nex N2.5 mini 是 Nex AGI 开源的新一代
Self-LLM 实战:使用 SGLang 部署 MiniCPM5-1B——OpenAI 兼容接口、思考/非思考双模式与原生工具调用
Self LLM 实战:使用 SGLang 部署 MiniCPM5 1B——OpenAI 兼容接口、思考/非思考双模式与原生工具调用 本篇指南聚焦于在 Linu
大模型人工智能教程本地部署微调Nex-N2.5-mini chat_template.jinja逐行精讲:154行完整解析工具调用XML格式、多步工具链与思考块
Nex N2.5 mini chat_template.jinja逐行精讲:154行完整解析工具调用XML格式、多步工具链与思考块 这篇文章对开源多模态智能体模
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考