一、Qwen2.5-14B
1. 环境准备
# 创建并激活虚拟环境(推荐) python -m venv qwen_env source qwen_env/bin/activate # 安装依赖库(确保Python≥3.8) pip install vllm transformers torch2. 下载模型
pip install modelscope modelscope download --model 'Qwen/Qwen2.5-14B-Instruct' --local_dir 'path/to/dir'如果下载模型的时候提示没有权限
export MODELSCOPE_CACHE=/tmp/modelscope_cache modelscope download --model Qwen/Qwen2.5-7B-Instruct3. 启动服务
# 指定4张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1,2,3 # 设置模型路径和服务名称 MODEL_PATH="./Qwen2.5-14B-Instruct" SERVED_MODEL_NAME="Qwen2.5_14B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 4 \ # 使用4张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文4. 验证服务
发送测试请求(新终端)
curl http://localhost:8000/v1/models预期输出:
{"object":"list","data":[{"id":"qwen2.5_14B","object":"model"}]}5. 调用API示例
import openai client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen2.5_14B", messages=[{"role": "user", "content": "你好"}] ) print(response.choices[0].message.content)6. 远程调用API示例
首先本地获取IP地址
ifconfig然后远程使用,例如
import openai client = openai.OpenAI(base_url="http://10.233.23.133:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen2.5_14B", messages=[{"role": "user", "content": "你好"}] ) print(response.choices[0].message.content)二、Qwen3-14B
部署方式类似,但需要cuda版本12.4(可以nvidia-smi查看),transformers版本>=4.51.0。
1. 安装VLLM
1)创建 conda 环境
# 创建 conda 虚拟环境,环境名称为 vllm,python 的版本为 3.10 conda create -n vllm python=3.102)切换 vllm 环境
conda activate vllm这里有可能切换失败,可以尝试两种方案
conda init或者
source ~/.bashrc3)安装 vllm 和 modelscope
pip install -U vllm \ --pre \ --extra-index-url https://wheels.vllm.ai/nightly pip install modelscope2. 启动服务
创建run.sh文件
# 指定2张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1 # 设置模型路径和服务名称 MODEL_PATH="./Qwen3-14B" SERVED_MODEL_NAME="Qwen3_14B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行
sh run.sh3. 调用API示例
import openai client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none") response = client.chat.completions.create( model="qwen3-14B", messages=[{"role": "user", "content": "/no_think 你好"}] ) print(response.choices[0].message.content)三、关于虚拟环境在notebook使用
conda install ipykernel python -m ipykernel install --user --name vllm四、Qwen3.5-27B
部署方式类似,但需要cuda版本13.0(可以nvidia-smi查看),Python 3.12。
然后vLLM 0.27.1 + transformers 5.15.0。
1. 安装VLLM
1)创建 conda 环境
# 创建 conda 虚拟环境,环境名称为 vllm,python 的版本为 3.12 conda create -n vllm python=3.122)切换 vllm 环境
conda activate vllm这里有可能切换失败,可以尝试两种方案
conda init或者
source ~/.bashrc3)安装 vllm 和 modelscope
uv pip install vllm==0.27.1 --torch-backend=cu130 pip install modelscope2. 启动服务
创建run.sh文件
# 指定2张GPU(根据实际GPU数量调整) export CUDA_VISIBLE_DEVICES=0,1 # 设置模型路径和服务名称 MODEL_PATH="./Qwen3.5-27B" SERVED_MODEL_NAME="Qwen3.5_27B" # 启动服务(关键参数说明见注释) python -m vllm.entrypoints.openai.api_server \ --model "$MODEL_PATH" \ --served-model-name "$SERVED_MODEL_NAME" \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行
sh run.sh