news 2026/10/5 5:06:22

单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单

单张RTX 3090怎么挑配置?club-3090单卡部署选型指南,附全部slug清单

【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090

在单张 RTX 3090(24 GB)上跑本地大模型,club-3090项目把各种引擎、量化、上下文的组合都封装成了开箱即用的slug(配置名)——你只需要从 slug 清单里挑一个,两条命令就能让 Qwen3.6-27B、Gemma 4、MiMo 9B 等模型在你的 3090 上提供服务。本文带你 3 分钟看懂单卡部署选型逻辑,并附上全部 14 个单卡 slug 的完整清单。

1️⃣ 30秒快速选型:按需求挑配置

不用逐个看 slug,先对号入座你的使用场景(2026-09-23 官方推荐):

你的需求推荐 slug说明
长上下文 + 视觉,一张卡llamacpp/mimo9b-single-vision⭐MiMo 9B,262K 上下文,⚠️ 有注意事项
长上下文 + 视觉,追求模型能力llamacpp/qwen38-27b-single-iq4xsQwen3.8-27B + q4_0 KV,262K,🧪 实验性
跑 Gemma 系列vllm/gemma-12b-single-int8-mtp满血 262K 上下文
跑 Qwen3.6-27B(默认)vllm/minimal⭐✅ 生产级,32K 上下文,无视觉

⚠️ 注意:NVFP4 后缀的 slug 不能在 3090 上跑——它们需要 Hopper/Blackwell 架构(sm 9.0+)。3090 是 Ampere(sm 86),请避开清单里的*-nvfp4条目。

完整决策表和每个 slug 的背景讨论见官方选型页 docs/SINGLE_CARD.md。

2️⃣ 怎么读懂一个 slug?

slug 遵循引擎/模型+量化+拓扑-特性的命名规律,例如:

vllm/minimal llamacpp/qwen38-27b-single-iq4xs ik-llama/ornith9b-single
  • 前半段是推理引擎:vllm(需 Docker)、llamacpp(llama.cpp,免 Docker)、ik-llama;
  • 后半段是模型 + 量化方式(iq4xs、q8kxl、int8-mtp等)+ 单双卡拓扑(single/dual)+ 特性(vision视觉、mtp推测解码)。

每个 slug 都带一个状态标记,决定你能不能直接启动:

标记含义启动方式
✅ production生产级,放心用switch.sh <slug>直接启动
⚠️ caveats可用,但有文档化的限制switch.sh <slug>直接启动
🧪 experimental / 👁️ preview实验性/预览需要--force
🐣 incubating孵化中默认隐藏,--list --all查看

⚽ 带星号的⭐表示该模型在此拓扑下的默认配置。

3️⃣ 全部单卡 slug 清单(14 个)

以下是 docs/SINGLE_CARD.md 中由 tools/docs/slug_tables.py 从注册表自动生成的完整单卡 slug 清单:

Gemma 4 12B(统一版)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-12b-single-int8-mtp| ⚠️ | 262,144 | |llamacpp/gemma-12b-single-q8kxl| 🧪 | 262,144 | |vllm/gemma-12b-qat-w4a16-single| 🧪 | 262,144 |

Gemma 4 26B-A4B(MoE)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/gemma-26ba4b-single⭐ | ⚠️ | 176,000 |

MiMo V2.6 Distill Qwen 9B(小米)| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/mimo9b-single-vision⭐ | ⚠️ | 262,144 |

Ornith 1.0 9B| Slug | 状态 | 最大上下文 | |---|---|---:| |ik-llama/ornith9b-single| 🧪 | 262,144 |

Qwen 3.6 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/minimal⭐ | ✅ 生产 | 32,768 | |vllm/qwen-27b-single-nvfp4| ⚠️ 需 sm 9.0+(3090 不适用) | 65,536 |

Qwen 3.6 35B-A3B(MoE)| Slug | 状态 | 最大上下文 | |---|---|---:| |vllm/qwen-35b-a3b-single-nvfp4| ⚠️ 需 sm 9.0+(3090 不适用) | 131,072 | |vllm/qwen-a3b-preview-single| 👁️ 预览 | 8,192 |

Qwen 3.8 27B| Slug | 状态 | 最大上下文 | |---|---|---:| |llamacpp/qwen38-27b-single-iq4xs| 🧪 | 262,144 | |llama-cpp-prism-mtp/qwen38-27b-single-ternary-mtp| 🧪 | 262,144 | |llama-cpp-prism/qwen38-27b-single-ternary-pq2| 🐣 | 262,144 | |vllm/qwen38-27b-single-nvfp4| 🧪 | 65,536 |

💡 每个 slug 背后对应一个 compose 文件(如 models/qwen3.6-27b/vllm/compose/single/autoround-int4/minimal.yml),所有条目统一登记在 scripts/lib/profiles/registry.yaml 注册表中。

4️⃣ 三步启动:从克隆到出词

# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/cl/club-3090.git cd club-3090 # 2. 下载模型权重(首次) bash scripts/setup.sh qwen3.6-27b # 3. 启动你选中的 slug bash scripts/switch.sh vllm/minimal bash scripts/switch.sh --force llamacpp/qwen38-27b-single-iq4xs # 🧪 类需 --force # 附赠:看看你的机器到底能跑哪些 bash scripts/switch.sh --list # 按硬件过滤,--all 含已退役条目

首次运行不熟悉流程?docs/GETTING_STARTED.md 有 5 分钟从克隆到curl出词的完整走查。

5️⃣ 单卡部署前必知的 4 个坑

  1. Qwen3.6 单卡 vLLM 的"悬崖":vllm/minimal在累积上下文达到约21–26K tokens时会出现性能悬崖(Cliff 2b),仅影响单卡 vLLM + Qwen3-Next 系模型;llama.cpp 和 Gemma 无此问题。长会话请上双卡。
  2. 空闲显存 ≠ 峰值显存:启动后首条长 prompt 会多占 0.5–1.5 GB。若 slug 启动后在长 prompt 上崩溃,把MAX_MODEL_LEN或GPU_MEMORY_UTILIZATION(降 0.03)调低即可。
  3. 和桌面共享显卡:优先降MAX_MODEL_LEN(干净的 KV 切分);GPU_MEMORY_UTILIZATION=0.80通常低于 vLLM 启动剖析的下限。
  4. 功耗墙也是配置项:3090 的功耗上限对 prefill/decode 吞吐影响显著,官方测过 Qwen3.6 在 3090 上不同功耗点下的表现曲线,跑长任务前值得看一眼:

6️⃣ 进阶:启动前先算显存够不够

不想"启动后再翻车"?项目自带 KV 缓存预算计算器 tools/kv-calc.py,能在启动前预测某配置能否塞进你的显存(误差带 ±1.5 GB):

# 24 GB 单卡能开到多大上下文? bash tools/kv-calc.py --model qwen3.6-27b --solve-max-ctx --vram 24 --mem-util 0.92

公式推导和每个模型的校准数据都在 docs/KV_MATH.md;硬件兼容性(4090/5090/A6000 等)见 docs/HARDWARE.md。

总结

  • 想省心:vllm/minimal(Qwen3.6-27B,生产级,32K)或vllm/gemma-26ba4b-single(176K)
  • 想长上下文+视觉:llamacpp/mimo9b-single-vision或llamacpp/qwen38-27b-single-iq4xs
  • 3090 用户避坑:所有*-nvfp4slug 与你无缘;长 Qwen3.6 会话注意 21–26K 悬崖
  • 选型后一条switch.sh起飞,翻车前先用kv-calc.py算一遍账 🚀

【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 5:06:06

企业AI应用模型路由实战:成本、延迟与质量的动态平衡

1. 模型路由到底在解决什么问题1.1 从一个真实场景说起去年下半年&#xff0c;我帮一家做智能客服的团队做架构评审。他们的产品每天要处理大约四十万次对话请求&#xff0c;后端接了三个不同规模的模型&#xff1a;一个轻量级的用于意图识别和简单问答&#xff0c;一个中等规模…

作者头像 李华
网站建设 2026/10/5 5:06:01

OFDM MATLAB仿真完整指南:从参数配置到误码率曲线排坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/5 5:04:47

Nessus漏洞扫描全流程实践:从安装部署到报告分析与加固复扫

简介&#xff1a;一份面向网络安全专业学生的实验报告&#xff0c;以Nessus扫描工具的使用为核心。内容围绕工具安装配置、插件库部署与客户端管理展开&#xff0c;在局域网指定IP段扫描和本机扫描两种场景下&#xff0c;完整记录了扫描配置过程与结果输出&#xff0c;包括对离…

作者头像 李华
网站建设 2026/10/5 5:04:46

企业上网行为管理方案落地指南:深信服AC部署与策略配置避坑实战

简介&#xff1a;面向企业IT管理者、网络安全运维人员的深信服上网行为管理解决方案模版&#xff0c;聚焦互联网环境下“看不见、管不住”的典型痛点&#xff0c;系统梳理了用户终端多样化、应用与内容不可视、P2P及关键业务带宽难管控等核心需求&#xff0c;并结合网络安全法审…

作者头像 李华
网站建设 2026/10/5 5:04:44

Windows Server 2016下的IIS+PHP+MySQL环境搭建与排错实战

接到一台 Windows Server 2016 的机器&#xff0c;要求把 PHP 环境和 MySQL 一次跑通&#xff0c;第一反应是“又来活了”。这类需求在企业内网里其实相当常见&#xff1a;有人接手了历史遗留的 PHP 项目&#xff0c;或者部门采购的 OA、ERP、报表系统指定要跑在 Windows 生态里…

作者头像 李华
网站建设 2026/10/5 5:04:34

用C# Winform调用百度AI OCR,打造你的截图文字提取小工具

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华