单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单
【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090
在单张 RTX 3090(24 GB)上跑本地大模型,club-3090项目把各种引擎、量化、上下文的组合都封装成了开箱即用的slug(配置名)——你只需要从 slug 清单里挑一个,两条命令就能让 Qwen3.6-27B、Gemma 4、MiMo 9B 等模型在你的 3090 上提供服务。本文带你 3 分钟看懂单卡部署选型逻辑,并附上全部 14 个单卡 slug 的完整清单。
1️⃣ 30秒快速选型:按需求挑配置
不用逐个看 slug,先对号入座你的使用场景(2026-09-23 官方推荐):
| 你的需求 | 推荐 slug | 说明 |
|---|---|---|
| 长上下文 + 视觉,一张卡 | llamacpp/mimo9b-single-vision⭐ | MiMo 9B,262K 上下文,⚠️ 有注意事项 |
| 长上下文 + 视觉,追求模型能力 | llamacpp/qwen38-27b-single-iq4xs | Qwen3.8-27B + q4_0 KV,262K,🧪 实验性 |
| 跑 Gemma 系列 | vllm/gemma-12b-single-int8-mtp | 满血 262K 上下文 |
| 跑 Qwen3.6-27B(默认) | vllm/minimal⭐ | ✅ 生产级,32K 上下文,无视觉 |
⚠️ 注意:NVFP4 后缀的 slug 不能在 3090 上跑——它们需要 Hopper/Blackwell 架构(sm 9.0+)。3090 是 Ampere(sm 86),请避开清单里的
*-nvfp4条目。
完整决策表和每个 slug 的背景讨论见官方选型页 docs/SINGLE_CARD.md。
2️⃣ 怎么读懂一个 slug?
slug 遵循引擎/模型+量化+拓扑-特性的命名规律,例如:
vllm/minimal llamacpp/qwen38-27b-single-iq4xs ik-llama/ornith9b-single- 前半段是推理引擎:
vllm(需 Docker)、llamacpp(llama.cpp,免 Docker)、ik-llama; - 后半段是模型 + 量化方式(
iq4xs、q8kxl、int8-mtp等)+ 单双卡拓扑(single/dual)+ 特性(vision视觉、mtp推测解码)。
每个 slug 都带一个状态标记,决定你能不能直接启动:
| 标记 | 含义 | 启动方式 |
|---|---|---|
| ✅ production | 生产级,放心用 | switch.sh <slug>直接启动 |
| ⚠️ caveats | 可用,但有文档化的限制 | switch.sh <slug>直接启动 |
| 🧪 experimental / 👁️ preview | 实验性/预览 | 需要--force |
| 🐣 incubating | 孵化中 | 默认隐藏,--list --all查看 |
⚽ 带星号的⭐表示该模型在此拓扑下的默认配置。
3️⃣ 全部单卡 slug 清单(14 个)
以下是 docs/SINGLE_CARD.md 中由 tools/docs/slug_tables.py 从注册表自动生成的完整单卡 slug 清单:
Gemma 4 12B(统一版)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-12b-single-int8-mtp| ⚠️ | 262,144 | |llamacpp/gemma-12b-single-q8kxl| 🧪 | 262,144 | |vllm/gemma-12b-qat-w4a16-single| 🧪 | 262,144 |
Gemma 4 26B-A4B(MoE)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-26ba4b-single⭐ | ⚠️ | 176,000 |
MiMo V2.6 Distill Qwen 9B(小米)| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/mimo9b-single-vision⭐ | ⚠️ | 262,144 |
Ornith 1.0 9B| Slug | 状态 | 最大上下文 | |---|---|---:| |ik-llama/ornith9b-single| 🧪 | 262,144 |
Qwen 3.6 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/minimal⭐ | ✅ 生产 | 32,768 | |vllm/qwen-27b-single-nvfp4| ⚠️ 需 sm 9.0+(3090 不适用) | 65,536 |
Qwen 3.6 35B-A3B(MoE)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/qwen-35b-a3b-single-nvfp4| ⚠️ 需 sm 9.0+(3090 不适用) | 131,072 | |vllm/qwen-a3b-preview-single| 👁️ 预览 | 8,192 |
Qwen 3.8 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/qwen38-27b-single-iq4xs| 🧪 | 262,144 | |llama-cpp-prism-mtp/qwen38-27b-single-ternary-mtp| 🧪 | 262,144 | |llama-cpp-prism/qwen38-27b-single-ternary-pq2| 🐣 | 262,144 | |vllm/qwen38-27b-single-nvfp4| 🧪 | 65,536 |
💡 每个 slug 背后对应一个 compose 文件(如 models/qwen3.6-27b/vllm/compose/single/autoround-int4/minimal.yml),所有条目统一登记在 scripts/lib/profiles/registry.yaml 注册表中。
4️⃣ 三步启动:从克隆到出词
# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/cl/club-3090.git cd club-3090 # 2. 下载模型权重(首次) bash scripts/setup.sh qwen3.6-27b # 3. 启动你选中的 slug bash scripts/switch.sh vllm/minimal bash scripts/switch.sh --force llamacpp/qwen38-27b-single-iq4xs # 🧪 类需 --force # 附赠:看看你的机器到底能跑哪些 bash scripts/switch.sh --list # 按硬件过滤,--all 含已退役条目首次运行不熟悉流程?docs/GETTING_STARTED.md 有 5 分钟从克隆到curl出词的完整走查。
5️⃣ 单卡部署前必知的 4 个坑
- Qwen3.6 单卡 vLLM 的"悬崖":
vllm/minimal在累积上下文达到约21–26K tokens时会出现性能悬崖(Cliff 2b),仅影响单卡 vLLM + Qwen3-Next 系模型;llama.cpp 和 Gemma 无此问题。长会话请上双卡。 - 空闲显存 ≠ 峰值显存:启动后首条长 prompt 会多占 0.5–1.5 GB。若 slug 启动后在长 prompt 上崩溃,把
MAX_MODEL_LEN或GPU_MEMORY_UTILIZATION(降 0.03)调低即可。 - 和桌面共享显卡:优先降
MAX_MODEL_LEN(干净的 KV 切分);GPU_MEMORY_UTILIZATION=0.80通常低于 vLLM 启动剖析的下限。 - 功耗墙也是配置项:3090 的功耗上限对 prefill/decode 吞吐影响显著,官方测过 Qwen3.6 在 3090 上不同功耗点下的表现曲线,跑长任务前值得看一眼:
6️⃣ 进阶:启动前先算显存够不够
不想"启动后再翻车"?项目自带 KV 缓存预算计算器 tools/kv-calc.py,能在启动前预测某配置能否塞进你的显存(误差带 ±1.5 GB):
# 24 GB 单卡能开到多大上下文? bash tools/kv-calc.py --model qwen3.6-27b --solve-max-ctx --vram 24 --mem-util 0.92公式推导和每个模型的校准数据都在 docs/KV_MATH.md;硬件兼容性(4090/5090/A6000 等)见 docs/HARDWARE.md。
总结
- 想省心:
vllm/minimal(Qwen3.6-27B,生产级,32K)或vllm/gemma-26ba4b-single(176K) - 想长上下文+视觉:
llamacpp/mimo9b-single-vision或llamacpp/qwen38-27b-single-iq4xs - 3090 用户避坑:所有
*-nvfp4slug 与你无缘;长 Qwen3.6 会话注意 21–26K 悬崖 - 选型后一条
switch.sh起飞,翻车前先用kv-calc.py算一遍账 🚀
【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考