news 2026/8/18 15:47:08

VLLM部署Qwen模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
VLLM部署Qwen模型

一、Qwen2.5-14B

1. 环境准备

# 创建并激活虚拟环境(推荐) python -m venv qwen_env source qwen_env/bin/activate # 安装依赖库(确保Python≥3.8) pip install vllm transformers torch

2. 下载模型

pip install modelscope modelscope download --model 'Qwen/Qwen2.5-14B-Instruct' --local_dir 'path/to/dir'

如果下载模型的时候提示没有权限

export MODELSCOPE_CACHE=/tmp/modelscope_cache modelscope download --model Qwen/Qwen2.5-7B-Instruct

3. 启动服务

# 指定4张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1,2,3 # 设置模型路径和服务名称 MODEL_PATH="./Qwen2.5-14B-Instruct" SERVED_MODEL_NAME="Qwen2.5_14B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 4 \ # 使用4张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文

4. 验证服务

发送测试请求(新终端)

curl http://localhost:8000/v1/models

预期输出:

{"object":"list","data":[{"id":"qwen2.5_14B","object":"model"}]}

5. 调用API示例​​

import openai client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen2.5_14B", messages=[{"role": "user", "content": "你好"}] ) print(response.choices[0].message.content)

6. 远程调用API示例

首先本地获取IP地址

ifconfig

然后远程使用,例如

import openai client = openai.OpenAI(base_url="http://10.233.23.133:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen2.5_14B", messages=[{"role": "user", "content": "你好"}] ) print(response.choices[0].message.content)

二、Qwen3-14B

部署方式类似,但需要cuda版本12.4(可以nvidia-smi查看),transformers版本>=4.51.0。

1. 安装VLLM

1)创建 conda 环境

# 创建 conda 虚拟环境,环境名称为 vllm,python 的版本为 3.10 conda create -n vllm python=3.10

2)切换 vllm 环境

conda activate vllm

这里有可能切换失败,可以尝试两种方案

conda init

或者

source ~/.bashrc

3)安装 vllm 和 modelscope

pip install -U vllm \ --pre \ --extra-index-url https://wheels.vllm.ai/nightly pip install modelscope
2. 启动服务

创建run.sh文件

# 指定2张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1 # 设置模型路径和服务名称 MODEL_PATH="./Qwen3-14B" SERVED_MODEL_NAME="Qwen3_14B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文

然后命令行运行

sh run.sh

3. 调用API示例​​

import openai client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen3-14B", messages=[{"role": "user", "content": "/no_think 你好"}] ) print(response.choices[0].message.content)

三、关于虚拟环境在notebook使用

conda install ipykernel python -m ipykernel install --user --name vllm

四、Qwen3.5-27B

部署方式类似,但需要cuda版本13.0(可以nvidia-smi查看),Python 3.12。
然后vLLM 0.27.1 + transformers 5.15.0。

1. 安装VLLM

1)创建 conda 环境

# 创建 conda 虚拟环境,环境名称为 vllm,python 的版本为 3.12 conda create -n vllm python=3.12

2)切换 vllm 环境

conda activate vllm

这里有可能切换失败,可以尝试两种方案

conda init

或者

source ~/.bashrc

3)安装 vllm 和 modelscope

uv pip install vllm==0.27.1 --torch-backend=cu130 pip install modelscope
2. 启动服务

创建run.sh文件

# 指定2张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1 # 设置模型路径和服务名称 MODEL_PATH="./Qwen3.5-27B" SERVED_MODEL_NAME="Qwen3.5_27B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文

然后命令行运行

sh run.sh
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/18 15:42:47

AI智能体二进制逆向分析:CrackMeBench基准测试平台构建与实践

1. 项目缘起:当AI智能体遇上二进制逆向最近在折腾AI智能体(Agents)相关的项目,特别是想让它们去处理一些更“硬核”的任务,比如分析软件、理解程序逻辑。一个很自然的想法冒了出来:能不能让智能体去尝试破解…

作者头像 李华