news 2026/9/29 16:10:23

Nex-N2.5-Pro 开源部署与使用指南:SGLang Docker 启动、思维模式控制与工具调用实战

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Nex-N2.5-Pro 开源部署与使用指南:SGLang Docker 启动、思维模式控制与工具调用实战
  • 大模型
  • 基础模型
  • 多模态
  • AI Agent
  • 计算机视觉

【免费下载链接】Nex-N2.5-Pro

项目地址:https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-Pro
点击查看免费下载

本文基于 Nex-N2.5 模型家族官方发布说明与开源仓库,系统讲解以Nex-N2.5-Pro为代表的 Agentic 模型如何通过定制 SGLang 镜像完成本地/多卡部署、如何配置采样参数与思维模式、如何开启函数调用与推理解析,并结合仓库内的 config.json、chat_template.jinja 等文件深入解析底层实现。读完本文,你将能够独立完成 Nex-N2.5 三档模型的 Docker 启动、OpenAI 兼容接口调用,以及面向"电脑操控 + 网页浏览 + 视觉反馈自校正"的长程 Agent 任务的工程配置。

一、Nex-N2.5 是什么:面向真实环境长程任务的 Agentic 模型家族

Nex-N2.5 是 Nex-AGI 推出的下一代 Agentic 模型家族,定位是"为真实世界环境中的长程任务(long-horizon tasks)而构建"。官方发布口径中,这一代模型强化了持续行动 + 通过视觉反馈自我校正的能力——模型可以直接操作电脑与浏览器,也能自主执行并测试程序。在这个体系里,视觉不再只是一个输入模态,而是 Agent感知环境、验证结果、推进任务的关键接口。

Nex-N2.5 共分三个尺寸档位,本仓库镜像对应其中的Pro档:

档位定位
Nex-N2.5-mini轻量档,延续 Nex-N2 的多模态基础,聚焦 computer use、web browsing 与视觉 grounding 的 Agent 能力,适合单卡/双卡部署
Nex-N2.5-Pro主力档(本仓库),同样基于 Nex-N2 的多模态基础做定向增强,平衡性能与部署成本
Nex-N2.5-Max旗舰档,构建于 1.6 万亿参数的纯文本 Mixture-of-Experts(MoE)基座之上,是首次在万亿参数规模完成系统化后训练的产物

在训练维度,官方还强调这一代扩大了 Agent 训练环境、任务类型与生产力场景的范围,并在更大模型中积累了 Agentic 能力训练的实际经验。模型权重将以开源形式发布,同时提供托管在线服务。

二、开源仓库组成与权重获取

本仓库是Nex-N2.5-Pro的开源镜像,根目录下包含推理与部署所需的全部配置文件:

文件作用
config.json模型架构与量化配置(qwen3_5_moe)
chat_template.jinja官方 Chat 模板,内置思维模式、工具调用、图文/视频占位处理
tokenizer_config.json分词器配置(Qwen2Tokenizer,model_max_length262144)
tokenizer.json分词器词表文件
processor_config.json多模态 Processor(Qwen3VLProcessor,图像 + 视频预处理)
preprocessor_config.json图像预处理器参数
model-00001-of-00122.safetensors~model-00122-of-00122.safetensors122 个权重分片
model.safetensors.index.json权重分片索引(经 Git LFS 管理)
figures/Nex-N2.5-Benchmark-white.png官方 Benchmark 总览图

需要特别说明的是:仓库中的*.safetensors权重文件以Git LFS 指针形式存储(本地文件仅 100 余字节,内容为version https://git-lfs.github.com/spec/v1头部),因此通过git clone拉取仓库后,还需执行git lfs pull才能将真实权重下载到本地。获取权重后,即可按下文方式部署。

三、架构速览:从 config.json 看 Nex-N2.5-Pro 的实现

尽管 README 聚焦使用层面,但仓库内的 config.json 提供了充分的架构证据,能帮助我们理解部署参数为何如此设置。

3.1 模型基座与总体结构

  • 架构:Qwen3_5MoeForConditionalGeneration,model_type为qwen3_5_moe;
  • 精度:默认bfloat16(dtype: "bfloat16");
  • 上下文长度:max_position_embeddings: 262144,与 tokenizer_config.json 中的model_max_length: 262144一致——这也是部署命令中--context-length 262144的由来;
  • 词表:vocab_size: 248320,eos_token_id: 248044。

3.2 混合注意力:线性注意力 + 全注意力

text_config.layer_types列出的 60 层中,绝大多数为linear_attention,并每隔 4 层插入一层full_attention(full_attention_interval: 4)。这种线性注意力与全注意力混合的布局是长上下文场景下控制 KV 开销的关键——线性注意力层不随序列长度线性增长缓存,全注意力层则保留关键位置的精确检索能力。配套参数包括:

  • linear_key_head_dim: 128、linear_num_key_heads: 16
  • linear_value_head_dim: 128、linear_num_value_heads: 64
  • linear_conv_kernel_dim: 4、mamba_ssm_dtype: "float32"
  • head_dim: 256、num_attention_heads: 32、num_key_value_heads: 2

这也解释了 README 部署命令中--mamba-scheduler-strategy extra_buffer这一调度参数的存在意义。

3.3 MoE 配置

  • num_experts: 512,num_experts_per_tok: 10(每 token 激活 10 个专家);
  • shared_expert_intermediate_size: 1024、moe_intermediate_size: 1024;
  • router_aux_loss_coef: 0.001,output_router_logits: false。

大专家数 + 稀疏激活是万亿参数 MoE 的典型形态,部署时通过--ep-size(专家并行)与--moe-a2a-backend deepep等参数进行并行化。

3.4 FP8 块量化

quantization_config采用compressed-tensors(quant_method: "compressed-tensors",状态compressed),配置了名为FP8_BLOCK的量化组:

  • 权重:8 bit、strategy: "block"、block_structure: [128, 128]、对称、observer: "memoryless_minmax";
  • 输入激活:8 bit、strategy: "group"、group_size: 128、动态量化(dynamic: true)。

同时通过ignore规则排除了一部分敏感层(re:.*visual.*、re:.*embed_tokens.*、re:.*lm_head.*、re:.*mlp\.gate$、re:.*linear_attn\.conv1d$等),保证视觉塔、词嵌入与门控路由保持更高精度。

3.5 多模态视觉塔

vision_config表明其视觉编码器延续 Qwen3VL 风格:patch 16、temporal patch 2、27 层深度、hidden_size: 1152、out_hidden_size: 4096(对齐语言侧 hidden size)、spatial_merge_size: 2,并支持视频输入(temporal_patch_size: 2)。语言侧同时存在image_token_id: 248056、video_token_id: 248057与vision_start/end_token_id,与 processor_config.json 中Qwen3VLProcessor的图像/视频双路预处理(视频默认fps: 2、max_frames: 768、min_frames: 4)构成完整的多模态链路。

四、性能表现:官方评测概览

官方在 coding、agentic workflows、computer use、multimodal understanding 四类场景下对mini / Pro / Max三档模型进行了评测。以下为 README 公布的完整结果(加粗为各基准最佳成绩,含并列;—表示数据不可用)。

4.1 文本基准(Text Benchmarks)

BenchmarkNex-N2.5-miniNex-N2.5-ProNex-N2.5-MaxClaude Opus 5GPT-5.6 SolKimi-K3GLM-5.3DeepSeek-V4-Pro-0813Qwen3.8-Max
CODING
Terminal-Bench 2.173.482.786.189.188.888.388.287.986.6
SWE-Bench Pro43.861.265.779.264.663.364.655.467.7
DeepSWE v1.136.155.865.673.772.767.566.962.869.3
AGENTIC
AutomationBench v1.0.632.344.250.250.345.846.748.243.239.8
Toolathlon Verified54.668.574.776.574.976.573.074.172.5
GDPval-AA v2144616281713183117111675176315801717
Job Bench28.541.453.665.745.452.958.254.153.4
BrowseComp83.489.792.690.890.491.2———

4.2 多模态基准(Multimodal Benchmarks)

BenchmarkNex-N2.5-miniNex-N2.5-ProMiniMax-M3Claude Opus 5GPT-5.6 SolKimi-K3GLM-5.3-FlashDeepSeek-V4-Flash-VisionQwen3.8-Max
OSWorld-Verified71.282.275.283.483.284.862.376.786.1
OSWorld-230.556.422.368.362.758.3——46.7
WebTest48.652.8——54.0———52.3
WebArena-Verified63.467.6——69.771.6—62.366.8
OSWorld-G82.987.4—76.877.779.683.359.484.9
Vision2Web52.968.259.0—79.8———75.1
SWE-MM25.538.2—59.440.237.320.639.239.2
OmniDoc89.792.291.6—92.9———92.1

评测方法脚注(官方口径):

  1. 分数来源:凡有公开来源的分数取自官方 Benchmark 榜单及模型厂商最新评测报告(包括 Kimi-K3、Qwen3.8-Max、GLM-5.3、HY4 报告);无公开来源的结果由官方自评获得。
  2. 采样参数:官方评测统一使用temperature = 0.7、top_p = 0.95、top_k = 40。
  3. 评测框架:Coding 类任务使用 NexAU 框架评测。
  4. DeepSeek-V4-Pro:评测使用 DeepSeek-V4-Pro-0813 版本。
  5. AutomationBench:使用 Public 版本。
  6. BrowseComp:当 token 用量超过模型上下文窗口的 60% 时,采用 Summary context-compaction 策略。
  7. Vision2Web:报告的是 Frontend、Webpage、Website 三个类别的平均分,使用 Gemini-3.5-Flash 作为 VLM 裁判、GLM-5V-Turbo (Claude Code) 作为 GUI Agent。
  8. Computer-use / browser-use 基准(OSWorld、WebTest、WebArena)使用官方 NexCUA 评测框架,grounding 坐标归一化到 0–1000 尺度;NexCUA 项目即将开源。
  9. WebTestBench:以oracle mode评测,仅用 ground-truth 清单评估缺陷检测能力,不包含清单生成环节。
  10. 记法:加粗为最佳成绩(含并列),—表示数据不可用。

五、Docker 部署:基于定制 SGLang 的一键启动

官方提供预构建 Docker 镜像nexagi/sglang:v0.5.18-nex-patch,其中预装了经过定制修改的sglang分支,可直接承载 Nex-N2.5 全系模型。启动命令的核心是python3 -m sglang.launch_server加一系列模型相关参数。

5.1 Nex-N2.5-Pro:单节点 8 × H100

docker run --gpus all --shm-size 32g --ipc=host \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 8 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-Pro/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer

要点说明:

  • --gpus all --shm-size 32g --ipc=host:暴露全部 GPU、放大共享内存并共享主机 IPC 命名空间,是 SGLang 多卡推理的常规要求;
  • -v /path/to/your/model:/model将权重目录挂载进容器,--model-path /model指向容器内路径;
  • --tp 8:8 卡张量并行;
  • --reasoning-parser qwen3:将模型的思考轨迹与最终回答分离(详见下文);
  • --tool-call-parser qwen3_coder:开启函数调用解析;
  • --chat-template指定本仓库根目录下的 chat_template.jinja;
  • --mamba-scheduler-strategy extra_buffer:为线性注意力/Mamba 风格层预留额外缓冲,这是混合注意力模型特有的调度参数。

5.2 Nex-N2.5-mini:单节点 2 × H100

docker run --gpus all --shm-size 32g --ipc=host \ -p 30000:30000 \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /model \ --tp 2 \ --host 0.0.0.0 --port 30000 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder \ --chat-template /path/to/nex-N2.5-mini/chat-template.jinja \ --mamba-scheduler-strategy extra_buffer

5.3 Nex-N2.5-Max:多节点 16 × H200

Max 档需2 个节点共 16 块 H200,且每个节点上运行同一条命令,通过环境变量区分角色:

  • <node-rank>:主节点填0,另一节点填1;
  • <node0-ip>:主节点 IP(其余节点必须可达)。
docker run --gpus all --shm-size 32g --network host \ -v /path/to/your/model:/model \ nexagi/sglang:v0.5.18-nex-patch \ python3 -m sglang.launch_server \ --model-path /path/to/your/model \ --trust-remote-code \ --host 0.0.0.0 \ --port 8000 \ --nnodes 2 \ --node-rank "${NODE_RANK}" \ --dist-init-addr "${MASTER_ADDR}:5000" \ --tp 16 \ --pp-size 1 \ --dp 1 \ --ep-size 16 \ --attention-backend dsv4 \ --kv-cache-dtype fp8_e4m3 \ --page-size 256 \ --moe-a2a-backend deepep \ --moe-runner-backend deep_gemm \ --moe-dense-tp-size 1 \ --deepep-mode auto \ --context-length 262144 \ --mem-fraction-static 0.84 \ --chunked-prefill-size 8192 \ --enable-mixed-chunk \ --disable-overlap-schedule \ --max-running-requests 64 \ --cuda-graph-max-bs-decode 64 \ --cuda-graph-backend-decode full \ --cuda-graph-backend-prefill disabled \ --chat-template /path/to/nex-n2.5-max/chat_template.jinja \ --reasoning-parser deepseek-r1 \ --tool-call-parser qwen3_coder

5.4 Max 档关键参数解读

参数取值作用
--nnodes 2 --node-rank ${NODE_RANK}2 / 0 或 1双节点并行,每节点按 rank 分工
--dist-init-addr "${MASTER_ADDR}:5000"主节点 IP:端口分布式初始化地址
--tp 16 --pp-size 1 --dp 1 --ep-size 1616/1/1/16张量并行 16、不做流水与数据并行、专家并行 16(契合 512 专家 × 每 token 10 专家激活的 MoE 结构)
--attention-backend dsv4dsv4指定注意力后端实现
--kv-cache-dtype fp8_e4m3fp8_e4m3KV 缓存使用 FP8,显著降低长上下文显存占用
--page-size 256256分页缓存页大小
--moe-a2a-backend deepep --moe-runner-backend deep_gemmdeepep / deep_gemmMoE All-to-All 通信与算子后端,配合--deepep-mode auto
--moe-dense-tp-size 11稠密专家部分的张量并行度
--context-length 262144262144与模型max_position_embeddings对齐
--mem-fraction-static 0.840.84预分配显存比例
--chunked-prefill-size 8192 --enable-mixed-chunk8192分块 Prefill 与混合分块,降低长序列首字延迟
--disable-overlap-schedule—关闭调度重叠(配合 deep_gemm 后端)
--max-running-requests 6464最大并发请求数
--cuda-graph-max-bs-decode 6464Decode 阶段 CUDA Graph 最大 batch
--cuda-graph-backend-decode fullfullDecode 全量 CUDA Graph
--cuda-graph-backend-prefill disableddisabledPrefill 阶段不启用 CUDA Graph
--trust-remote-code—信任远端代码(加载含自定义代码的模型)

六、推荐采样参数

为获得最佳生成质量,官方推荐的采样参数为:

  • temperature:0.7
  • top_p:0.95
  • top_k:40

这也与官方评测所用的采样设置一致(见上文脚注 2),可作为接入服务时的默认值。

七、思维模式控制:reasoning_effort

Nex-N2.5 通过请求中的reasoning_effort字段控制思考行为,共有三种模式:

reasoning_effort模式行为
"none"Non-thinking不输出思考轨迹,直接回答
"medium"(默认)Adaptive thinking让模型自行决定是否思考以及思考多少
"high"Thinking回答前总是先思考

以"自适应思考"为例,在 OpenAI 兼容的 Chat Completions 请求中这样设置(<served-model-name>替换为你的服务暴露的模型名):

{ "model": "<served-model-name>", "messages": [ {"role": "user", "content": "Explain how binary search works."} ], "reasoning_effort": "medium" }

模板层实现佐证:查看仓库内的 chat_template.jinja 末尾(add_generation_prompt分支,约 L143–L153),可以看到reasoning_effort如何被消费:

  • 未定义或为none时输出<think>\n\n</think>\n\n(空思考块,等价于关闭思考);
  • 为high时输出<think>\n(强制开启思考轨迹);
  • 其余情况(含默认)输出<think>,交由模型自适应决定是否继续思考。

需要注意的是:Nex-N2.5 的 Chat 模板直接消费reasoning_effort;而诸如enable_thinking、thinking_mode这类字段需要在网关层做语义翻译后才能生效。

八、函数调用(Function Calling)

Nex 系列模型具备完善的函数调用能力。启动服务时加入--tool-call-parser qwen3_coder即可启用:

python -m sglang.launch_server --model-path /path/to/your/model --tool-call-parser qwen3_coder

chat_template.jinja 中对工具调用有完整的内建支持,可从模板代码中看到三个关键机制:

  1. 工具注入:当请求携带tools列表时,模板自动构造# Tools系统消息,将每个工具的 JSON Schema(tool | tojson)以<tools>...</tools>形式注入(约 L45–L53);
  2. 调用格式约束:模板向模型声明严格的 XML 调用格式——外层<tool_call></tool_call>嵌套<function=函数名></function>,参数以<parameter=参数名>值</parameter>逐条给出,并要求"必要参数必须填写、可在调用前给出自然语言推理、但调用后不得再补充说明"(约 L53);
  3. 多轮工具结果回填:模板会从消息尾部反向扫描用户消息,识别被<tool_response>...</tool_response>包裹的工具返回内容,并在渲染时将连续的tool角色消息合并进同一段user消息,从而支撑多步工具调用循环(约 L67–L80、L127–L138)。

此外,模板对多模态内容也有处理:图片与视频分别以<|vision_start|><|image_pad|><|vision_end|>、<|vision_start|><|video_pad|><|vision_end|>占位符注入(约 L8–L29),并支持Picture N:/Video N:编号提示;同时会显式拒绝系统消息中包含图片/视频(raise_exception('System message cannot contain images.'))。

九、推理解析器(Reasoning Parser)

当模型输出思考轨迹(reasoning trace)时,需要通过 SGLang 的 reasoning parser 将思考内容与最终回答分离:

  • Nex-N2.5-mini 与 Nex-N2.5-Pro:--reasoning-parser qwen3
  • Nex-N2.5-Max:--reasoning-parser deepseek-r1

上面的部署命令已包含正确的 parser 与--tool-call-parser qwen3_coder。Parser 负责从流式输出中剥离<think>...</think>之间的推理内容;而是否思考、思考多深,则由上一节的reasoning_effort决定。两者配合,即可获得"思考轨迹与工具调用均可解析"的结构化输出。

十、接入与验证建议

部署完成后,可通过 OpenAI 兼容接口向http://<host>:<port>/v1/chat/completions发起请求,model字段填写服务暴露的<served-model-name>(可用GET /v1/models查询)。一个完整的调用建议:

  1. 将temperature、top_p、top_k设为官方推荐值(0.7 / 0.95 / 40);
  2. 按任务类型设置reasoning_effort(日常问答用默认medium,追求稳定思考用high,低延迟场景用none);
  3. 涉及工具/浏览器/电脑操作时,确保服务启动命令带--tool-call-parser qwen3_coder;
  4. 长上下文场景确认服务侧--context-length与模型 262144 对齐,并关注官方 BrowseComp 评测中提到的"token 用量超过上下文 60% 时启用摘要压缩"这一实践。

注意事项:本仓库为只读开源镜像,部署前请确认已通过git lfs pull获取完整权重;--chat-template指向的是各模型对应的 chat_template.jinja(本文仓库根目录即 Pro 版模板)。若需对照更多实现细节,可在仓库中继续查阅 config.json、tokenizer_config.json、processor_config.json 与 preprocessor_config.json。

  • 大模型
  • 基础模型
  • 多模态
  • AI Agent
  • 计算机视觉

【免费下载链接】Nex-N2.5-Pro

项目地址:https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-Pro
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 16:10:16

社交网络提示设计实战:采写改测存五环节的10个高效工具

上个月我们团队做了一次内容矩阵复盘&#xff0c;结果让我很意外&#xff1a;同样是追一个热点话题&#xff0c;五个人各自写提示词&#xff0c;产出的稿子风格像五家不同的号。有人写得像新闻通稿&#xff0c;有人写得像朋友圈碎碎念&#xff0c;还有人写成了产品说明书。问题…

作者头像 李华
网站建设 2026/9/29 16:09:46

MySQL InnoDB事务底层原理:隔离级别、redo log与MVCC面试要点

最近几轮技术面试里&#xff0c;MySQL事务几乎成了必问项。而且问得越来越细&#xff0c;不是“事务的四个特性是什么”这种背诵题&#xff0c;而是“InnoDB里一条UPDATE到底是怎么提交的”“RR隔离级别会不会出现幻读”“你们生产环境为什么用默认的RR而不是RC”&#xff0c;这…

作者头像 李华
网站建设 2026/9/29 16:09:05

esp-idf 搭建 vscode 环境:用 TaoToken 统一 Key 打通编译与调试链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/29 16:08:33

CentOS上MySQL连接数打满?Too many connections排查与根治

1. 先搞懂“Too many connections”到底在说什么如果你在CentOS上跑MySQL&#xff0c;某天突然收到一条这样的报错&#xff1a;ERROR 1040 (HY000): Too many connections别怀疑&#xff0c;你的MySQL实例连接数已经打满了。这个报错的意思是&#xff1a;MySQL服务器当前允许同…

作者头像 李华
网站建设 2026/9/29 16:08:25

机器人上下料与Equator在线测量:无人质检单元设计与节拍优化

去年夏天接手的一个项目&#xff0c;客户精加工线突然要求全员检测。CNC节拍60秒一件&#xff0c;人工用检具测一件要两分钟&#xff0c;还得等冷却。三坐标倒是准&#xff0c;但放在恒温室里抬不进车间&#xff0c;更别提节拍。最后我们上了一套Equator自动化单元&#xff1a;…

作者头像 李华
网站建设 2026/9/29 16:08:18

C语言单链表插入操作详解:从原理到代码实战

1. 为什么很多教程教不会链表&#xff1a;先搞懂它到底解决了什么问题先问你一个问题&#xff1a;如果你要在数组的头部插入一个元素&#xff0c;会发生什么&#xff1f;答案是数组里所有元素都要往后挪一位&#xff0c;时间复杂度O(n)。如果这个数组有100万个元素&#xff0c;…

作者头像 李华