news 2026/9/17 17:50:27

081、开源模型部署:Ollama与vLLM

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
081、开源模型部署:Ollama与vLLM

081、开源模型部署:Ollama与vLLM

半夜两点,群里有人丢过来一条报错:Ollama 0.1.29加载Qwen2.5:7B,显存 12G,跑起来直接 OOM,还附带一句“是不是 Ollama 吃显存太狠了”。我第一反应不是去查显存,而是问他num_ctx设了多少。他回:默认。这就是问题的一半。Ollama 默认上下文长度是 2048,但很多人不知道的是,当你用ollama run或者 API 请求时不显式指定num_ctx,Ollama 在底层构建 KV Cache 时会按模型配置里的上下文来预分配显存,而 Qwen2.5 的模型配置里写了 32768,于是你的 12G 显存还没开始生成第一个 token 就已经被预分配吃光了。这个坑我在给客户调私有化部署时踩过不止一次,所以今天这篇笔记就从这里开始,聊聊 Ollama 和 vLLM 这两套主流开源部署方案到底该怎么选、怎么调、怎么避开那些让你凌晨三点怀疑人生的坑。

先把 Ollama 的“隐形显存”搞清楚

Ollama 的设计哲学是“开箱即用”,但“开箱即用”在推理场景里往往意味着“默认参数替你做了决定,而默认值不一定适合你的硬件”。上面说的num_ctx只是其中之一。另一个典型是Ollama的并发请求处理:默认OLLAMA_NUM_PARALLEL是 1,但如果你用 API 同时发多个请求,Ollama 会尝试为每个请求分

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/17 17:49:33

证券知识库构建实战:从文档解析到RAG检索优化

简介:一份围绕"证券知识库构建和应用"的PPT,面向金融科技、大模型应用方向从业者与学习者,系统拆解金融文档如何转化为可检索、可问答的知识库。包体为1个PPTX文件,压缩包约14.69MB,单文件但内容密度高。内容…

作者头像 李华
网站建设 2026/9/17 17:48:23

国产电源芯片选型避坑指南:DC-DC与LDO可靠性实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 17:47:31

CAN总线调试实战:物理层、协议栈与接收机制避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/17 17:46:21

AI论文平台:提升科研效率的智能工具

1. 学术研究效率革命:AI论文平台的价值解析在科研领域,文献检索与阅读时间约占学者工作量的40%。传统学术搜索引擎往往存在结果冗余、相关性差、更新滞后等问题。2026年新一代AI论文平台通过深度学习与自然语言处理技术,实现了从"人找信…

作者头像 李华
网站建设 2026/9/17 17:41:42

GARCH模型实战:波动率建模、ARCH检验与VaR预测

简介:这份PPT课件面向金融学、计量经济学方向的学生与研究人员,系统讲解GARCH类模型在金融时间序列波动性分析中的原理与应用。内容从Engle提出的ARCH过程切入,梳理条件异方差性的来源与ARCH(q)的建模思路,进而展开GARCH(1,1)及高…

作者头像 李华