在 AI 大模型的开发链路上,Ollama 是少数能把“下载模型、本地部署、API 调用、二次开发”串成同一条工作流的工具。它的定位很直接:把开源大模型从模型仓库拉到本地,用命令行启动一个服务,再让本地程序通过标准 HTTP 接口访问模型能力。和访问云端大模型 API 不同,Ollama 的数据不出本机,网络断了也能用,模型权重和推理参数完全由自己控制。这篇教程会从零开始,讲清楚 Ollama 的下载安装、本地部署、模型管理、API 接入和常见排错,不需要深度学习背景,只要会打开终端执行命令,就能把一个大模型真正跑在自己电脑上,并把它接入到自己的应用里。
1. 先理解 Ollama 解决什么问题,再动手安装
1.1 本地大模型和在线 API 的根本区别
使用大模型一般有两条路线。一条是调用云端 API,把数据发送到远程服务器,然后接收模型返回的文本或向量结果。另一条是本地部署,把模型权重下载到自己电脑或私有服务器上,推理过程完全在本地完成。
两者不是替代关系,而是使用场景不同。云端 API 的优势是开箱即用,不需要关心显存、推理框架和权重文件。本地部署的优势则是可控性:隐私数据不离开本机,推理过程不受服务商限流影响,离线环境也能工作,也不需要按 token 付费。
Ollama 解决的是本地部署这条路上最麻烦的一层。过去要本地跑一个大模型,需要手动完成以下工作:下载对应格式的权重文件、安装推理引擎、配置 GPU 或 CPU 加速、编写 API 封装、处理模型版本冲突。这些步骤对于只想把模型用起来的开发者来说,成本偏高。
Ollama 把这些环节压缩成了几条命令。它自己负责管理模型文件、加载模型运行环境、暴露 HTTP 接口,并提供命令行交互窗口。使用者只需要选模型、拉模型、跑模型,剩余细节交给 Ollama 处理。
1.2 Ollama 的核心运作机制
从架构上看,Ollama 可以分成三层:
- 模型仓库层:负责从模型源下载权重文件,并把模型按照名称、标签、参数配置组成可管理的目录。
- 运行时层:负责将模型加载进内存或显存,执行推理请求,并把结果返回。
- 服务层:默认监听本机
11434端口,对外提供 REST API 和 OpenAI 兼容接口,方便外部程序集成。
当你执行ollama run qwen2.5:7b这条命令时,Ollama 会先检查本地是否已经存在对应模型,不存在则拉取;存在则启动一个带交互界面的对话进程。如果外面程序要用这个模型,可以直接请求http://localhost:11434。
容易误解的地方在于:Ollama 本身并不是大模型,它更像是一个模型运行和管理框架。真正被下载下来的文件,是模型权重和配置的集合。Ollama 的价值在于,用统一的方式屏蔽了不同模型在加载方式、内存占用、参数格式上的差异。
1.3 本地部署能带来什么实际收益
把模型放在本地之后,可以直接把它们接到自己的项目中:
- 编写本地文档问答工具,模型读取本地知识库后回答问题。
- 在 IDE 插件中接本地模型,辅助代码补全和代码审查。
- 在无公网环境的服务器上部署私有问答服务。
- 用开源模型做批量文本分类、信息抽取和格式转换。
这些场景的共同特点是:对隐私有要求、对单次调用成本敏感、或者网络条件不允许访问外部 API。这也是为什么本地部署大模型在 2026 年仍然是开发者必学的一项技能。
2. 环境准备:硬件、系统和模型选择要先对齐
2.1 运行 Ollama 需要什么硬件条件
Ollama 本身非常轻量,真正消耗资源的是模型推理过程。不同参数规模的模型,对内存和显存的要求差异很大。
下面是一张硬件要求和实际体验的对应关系表,按普通开发机上常见配置给出参考:
| 模型参数规模 | 推荐内存/显存 | 运行速度体验 | 适用场景 |
|---|---|---|---|
| 1B~3B | 4GB 以上内存 | 很快,CPU 也能跑 | 文本分类、关键字提取、简单对话 |
| 7B~8B | 8GB 内存或 6GB 显存 | CPU 可运行但偏慢,GPU 更流畅 | 通用对话、代码生成、RAG 问答 |
| 14B~32B | 16GB 以上内存或 12GB 以上显存 | 推荐 GPU 运行 | 复杂推理、长文本摘要、业务助手 |
| 70B 以上 | 32GB 以上内存或 24GB 以上显存 | 需要多卡或量化 | 高质量生成、专业领域任务 |
以上数据是粗略经验值。实际占用还取决于量化方式、上下文长度和并发请求数。以 7B 模型为例,使用 4-bit 量化后,推理时需要的内存大约在 4GB 到 6GB 之间。如果设置了很长的上下文窗口,额外内存会继续增加。
这里要特别注意:显存不足时,Ollama 会自动退回到 CPU 推理,但速度会明显下降。在 CPU 上跑 7B 模型,通常每秒只能生成几个 token;在 GPU 上则可能达到每秒几十甚至上百个 token。
2.2 如何选择第一个要部署的模型
模型选择不是越大越好。参数多不代表在所有任务上都更合适,还要看推理延迟、内存占用和硬件条件。
一般来说,第一次入门选择 7B 级别的模型最合适。它体积适中,能在中端硬件上运行,生成质量也足够体验大模型的核心能力。常见的开源模型系列包括:
| 模型系列 | 特点 | 常见标签示例 |
|---|---|---|
| Qwen 系列 | 中文能力强,指令跟随稳定 | qwen2.5:7b |
| Llama 系列 | 生态完善,资料丰富 | llama3.1:8b |
| Phi 系列 | 体积小,适合轻量场景 | phi4:14b |
| DeepSeek 系列 | 推理和代码能力突出 | deepseek-r1:7b |
| Gemma 系列 | 由 Google 开源,多语言支持好 | gemma2:9b |
需要注意的是,模型标签会随版本更新而变化。拉取模型之前,建议先在 Ollama 官方模型库中确认当前可用的标签名,避免输入不存在的标签。
2.3 安装前检查清单
在下载安装包之前,先确认以下内容,可以减少后续很多麻烦:
- 操作系统版本。Windows 10 及以上、macOS 11 及以上、主流 Linux 发行版都可以运行。
- 磁盘剩余空间。Ollama 程序本身占用不大,但模型文件通常以 GB 计算。7B 量化模型约 4GB 到 5GB,更大模型需要预留更多空间。
- 终端工具的可用性。Windows 建议使用 PowerShell 或 Windows Terminal,Linux 和 macOS 使用自带终端即可。
- 是否已有 GPU 环境。有 NVIDIA 显卡时,需要保持显卡驱动较新版本。CPU 虽然可以运行,但体验差距明显。
- 网络是否稳定。首次拉取模型需要下载较大文件,网络波动会导致下载中断。
3. 下载与安装:Windows、macOS、Linux 三种平台的完整操作
3.1 三种平台的安装方式对比
Ollama 在三个主流平台上都有官方安装方式。先看整体对比:
| 平台 | 安装方式 | 安装后程序位置 | 模型存储默认位置 |
|---|---|---|---|
| Windows | 下载安装包,双击安装 | %LOCALAPPDATA%\Programs\Ollama | C:\Users\<用户名>\.ollama\models |
| macOS | 下载应用安装,或使用 Homebrew | /Applications/Ollama.app | ~/.ollama/models |
| Linux | 安装脚本或手动安装 deb/rpm 包 | /usr/local/bin/ollama | /usr/share/ollama/.ollama/models或~/.ollama/models |
以上路径是常见默认值,实际会因版本略有变化。下面分别说明具体步骤。
3.2 Windows 安装步骤
Windows 上安装 Ollama 最直接的方式是下载安装包。打开 Ollama 官网下载页,选择 Windows 版本,下载完成后运行安装程序。
安装过程没有复杂的选项,一路下一步即可。安装完成后,Ollama 会作为后台程序自动启动,并在系统托盘显示图标。
安装完成后,打开 PowerShell 或 Windows Terminal,执行:
ollama --version如果能输出版本号,说明安装成功。如果提示命令不存在,需要检查环境变量是否包含 Ollama 安装目录。安装目录通常在:
C:\Users\<用户名>\AppData\Local\Programs\Ollama手动添加环境变量时,路径要写到Ollama这一层。
注意:Windows 安装完成后,Ollama 会常驻后台。如果修改了环境变量或配置文件,需要退出托盘程序再重新启动,否则新配置不会生效。
3.3 macOS 安装步骤
macOS 有两种安装方式。一种是直接下载.dmg安装包,拖入 Applications 目录;另一种是使用 Homebrew:
brew install ollama使用 Homebrew 安装的 Ollama,后续升级也更方便:
brew upgrade ollama安装完成后,在终端里验证:
ollama --versionmacOS 上需要注意的一点是:首次运行 Ollama 时,如果系统弹出网络访问授权提示,需要允许。否则后续 API 请求可能无法被外部程序访问。
3.4 Linux 安装步骤
Linux 的官方推荐方式是一条安装命令:
curl -fsSL https://ollama.com/install.sh | sh脚本会自动识别系统架构和发行版,并完成安装。执行后验证:
ollama --version对于不能直接执行脚本的生产服务器,可以先下载脚本查看内容,确认无误后再执行。也可以从官方下载页获取.deb或.rpm安装包,用系统包管理器安装:
sudo dpkg -i ollama-linux-amd64.debLinux 服务器通常是无图形界面环境,安装完成后可以直接使用ollama serve启动服务,或者让 systemd 服务管理 Ollama 进程。
3.5 验证 Ollama 服务是否真正运行
安装完成并不代表服务已经准备好。要确认 Ollama 的服务端已经启动,可以执行:
ollama list如果看到NAME、ID、SIZE、MODIFIED这样的表头,说明服务端已经正常响应。即使列表为空,只要没有报错,就表示服务可用了。
还可以直接访问默认服务端口:
curl http://localhost:11434正常情况下会返回类似Ollama is running的响应。
4. 下载太慢的解决思路与模型存储目录修改
4.1 下载慢通常发生在哪两个阶段
下载慢存在两个不同阶段,需要分开处理。
第一阶段是下载 Ollama 安装包。安装包体积在几百 MB 级别,如果网络不稳定,下载可能会反复失败。第二阶段是拉取大模型权重文件。一个 7B 模型就是 4GB 以上的文件,即使速度不错也需要等待。绝大多数人反馈的“Ollama 下载太慢”,其实都是模型文件下载慢。
4.2 安装包下载慢的处理方式
安装包是二进制文件,下载源通常集中在官网。如果官网下载速度不理想,可以尝试以下方式:
- 检查是否使用了 HTTPS 协议,部分浏览器或下载工具在 HTTP 环境下会被限速。
- 把安装包下载任务交给支持断点续传的下载工具。
- 如果处于企业内网或校园网,可以询问网络管理员是否存在软件镜像缓存服务。
- 在 Linux 服务器上,如果官方脚本下载超时,可以先在本地下载 deb/rpm 安装包,再通过内网传输到目标服务器。
4.3 模型文件下载慢的解决策略
模型文件的下载源由 Ollama 官方托管,默认环境下直接从本地网络访问可能不够快。常规解决思路有三种:
第一种是换网络。使用更稳定的网络环境,或者把下载任务放到带宽空闲的时段。Ollama 的下载机制支持断点续传,中断后重新执行ollama pull,会从已下载部分继续,不需要从头再来。
第二种是换来源。Ollama 新版本支持从 ModelScope 等模型托管平台拉取模型。以 ModelScope 上的模型为例,命令格式如下:
ollama run modelscope.cn/<组织名>/<模型名>如果当前版本支持这种方式,它会直接从 ModelScope 下载模型,并在本地完成模型转换。不同版本对第三方来源的支持范围不同,落地前先确认版本行为。如果不支持,可以从 ModelScope 或 Hugging Face 下载 GGUF 格式权重文件,再通过 Modelfile 导入本地。
第三种是手动导入 GGUF 文件。具体操作在后面的 Modelfile 章节会展开。这里先记住一个核心思路:Ollama 不一定只能从官方源获取模型。只要模型文件是它支持的 GGUF 格式,就可以手动导入。
4.4 把模型安装到 D 盘或其他非系统磁盘
不少 Windows 用户会遇到 C 盘空间不足的问题。Ollama 默认会把模型存储在 C 盘用户目录下,这是一个非常常见的坑。
解决方法是修改环境变量OLLAMA_MODELS:
- 打开“系统属性 -> 环境变量”。
- 新建用户环境变量,变量名设置
OLLAMA_MODELS。 - 变量值设置为目标目录,例如
D:\ollama\models。 - 完全退出 Ollama 托盘程序,再重新启动。
- 执行
ollama list并重新拉取模型,确认模型文件写入新目录。
修改之后,已经下载的模型不会自动迁移。如果需要迁移已有模型,可以手动把旧目录下的models文件夹复制到新目录,并保持目录层级一致。
5. 拉取模型、运行对话和管理本地模型
5.1 核心命令速查表
熟悉表里的命令,就可以完成 90% 的日常操作:
| 命令 | 作用 |
|---|---|
ollama list | 查看本地已有模型列表 |
ollama pull <模型名> | 拉取模型 |
ollama run <模型名> | 运行模型,进入交互对话 |
ollama show <模型名> | 查看模型的参数、详情和配置 |
ollama cp <模型名> <新模型名> | 复制模型 |
ollama rm <模型名> | 删除模型 |
ollama stop <模型名> | 停止正在运行的模型 |
ollama serve | 启动 Ollama 服务进程 |
ollama --version | 查看版本号 |
5.2 拉取模型
拉取模型使用ollama pull命令。例如拉取 Qwen2.5 7B 模型:
ollama pull qwen2.5:7b执行后,终端会显示下载进度条。文件较大时需要等待。下载完成后,再次执行:
ollama list可以看到模型已经出现在列表中。
不同模型的标签要在拉取前确认。qwen2.5:7b表示 Qwen2.5 系列的 7B 版本。同样一个模型可能还有qwen2.5:3b、qwen2.5:14b等不同规模版本。
5.3 第一次跑通对话
拉取完成后,执行:
ollama run qwen2.5:7b此时会进入一个交互式对话界面,直接输入文字即可得到回复。输入/bye可以退出对话。
这种方式适合快速体验模型效果,但真正把模型接入项目时,通常不使用终端交互,而是调用 API。
5.4 以服务方式暴露 API
Ollama 在安装时会自动启动服务。Linux 上由 systemd 管理,Windows/macOS 上常驻后台。手动启动服务的命令是:
ollama serve服务默认监听127.0.0.1:11434。可以让它在局域网内提供服务:
OLLAMA_HOST=0.0.0.0:11434 ollama serve需要说明的是,这样修改后,所有能访问到该 IP 的设备都可以调用 Ollama API。生产环境不能直接这样暴露端口,必须加认证和访问控制,这一点在后面的最佳实践部分会再强调。
5.5 模型管理操作
删除模型:
ollama rm qwen2.5:7b查看模型更多信息:
ollama show qwen2.5:7b这条命令会返回模型的架构、参数量、上下文长度、是否量化等信息。在确定模型配置时很有帮助。
6. 实战开发:通过 API 把 Ollama 接进自己的程序
6.1 Ollama 内置了哪些 API
把模型接入程序,不需要写复杂的推理代码。Ollama 在11434端口上提供了标准 REST API。最常用的是/api/chat,用于多轮对话。
用 curl 快速测试:
curl http://localhost:11434/api/chat -d '{ "model": "qwen2.5:7b", "messages": [ {"role": "user", "content": "用一句话介绍你自己"} ], "stream": false }'响应中包含message字段,里面就是模型生成的内容。stream: false表示一次性返回完整结果。如果要对在线用户显示打字机效果,可以设置stream: true,响应会变成多个数据块逐行输出的 SSE 格式。
6.2 使用 Python 调用 API
Python 是最常用的接入方式。使用requests库即可:
import requests response = requests.post( "http://localhost:11434/api/chat", json={ "model": "qwen2.5:7b", "messages": [ {"role": "user", "content": "用一句话介绍你自己"} ], "stream": False, }, timeout=120, ) data = response.json() print(data["message"]["content"])运行之前确认已经安装了requests:
pip install requests这个示例请求在 7B 模型下通常能得到稳定的生成结果。timeout参数要设置合理,模型推理可能耗时较长,默认超时时间可能导致请求提前失败。
6.3 使用 OpenAI 兼容接口
Ollama 还提供了 OpenAI 兼容接口,地址是http://localhost:11434/v1。这意味着很多原本面向 OpenAI API 编写的代码,只需要修改base_url和api_key就可以切换到本地模型。
示例代码如下:
from openai import OpenAI client = OpenAI( base_url="http://localhost:11434/v1", api_key="ollama", ) resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "你好"}], ) print(resp.choices[0].message.content)这里api_key可以填任意非空字符串,因为本地服务不会校验密钥,只用于满足 OpenAI SDK 的参数要求。
注意:Ollama 默认接口没有鉴权机制。它默认只监听本机回环地址,所以单机使用是安全的。一旦把监听地址改为
0.0.0.0,就必须在外部增加认证代理或网关。
6.4 模型输出常见处理方式
在实际项目中,模型输出的内容可能包含多余的内容,不一定是干净的 JSON 或纯文本。通常要做以下处理:
- 清理首尾空白字符。
- 如果要求模型输出 JSON,配置系统提示词,并在解析失败时重试。
- 对大模型生成结果做长度限制,防止超长输出耗尽资源。
一个更稳的提示词把输出约束为 JSON:
请以 JSON 格式输出,不要包含任何额外说明文字。示例:{"result": "内容"}7. 定制自己的模型:Modelfile 与参数调优
7.1 什么是 Modelfile
Ollama 允许用户通过 Modelfile 文件创建自定义模型。它相当于一个模型配置文件,用来指定基础模型、系统提示词、推理参数和对话模板。创建出来的模型会作为独立模型出现在ollama list中。
这在实际项目里很重要。不同业务需要不同的系统提示词,比如客服助手、SQL 生成器、文本翻译器。与其在每个请求里重复写提示词,不如把这些配置固化成一个专属模型。
7.2 创建第一个自定义模型
先创建一个 Modelfile,内容如下:
FROM qwen2.5:7b SYSTEM 你是一位资深运维工程师,回答问题时必须用中文,并且先给结论再给解释。 PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 8192然后在同一目录下执行:
ollama create ops-assistant -f Modelfile创建完成后,运行这个模型:
ollama run ops-assistant这时模型会使用 Modelfile 中定义的系统和参数行为。这个模型的名称是ops-assistant,在 API 调用中可以直接通过这个名称访问。
7.3 常用参数说明
Modelfile 中的PARAMETER指令对应 Ollama 支持的推理参数:
| 参数 | 含义 | 默认值 | 调大影响 | 调小影响 |
|---|---|---|---|---|
temperature | 控制随机性 | 0.8 | 输出更多样,可能不稳定 | 输出更确定,偏保守 |
top_p | 核采样候选集 | 0.9 | 候选词更多 | 候选词更少 |
top_k | 限制候选 token 数 | 40 | 更多样 | 更集中 |
num_ctx | 上下文窗口长度 | 2048 | 能处理更长文本,内存需求增加 | 内存占用低,长文本被截断 |
repeat_penalty | 重复惩罚系数 | 1.1 | 减少重复内容 | 重复内容更容易出现 |
seed | 随机种子 | 0 | 相同输入可复现 | 每次结果不同 |
参数并非越大越好。num_ctx调大会显著增加推理时的显存和内存占用,不能随便设置成几万。
7.4 从 GGUF 文件导入自定义模型
如果网络不方便下载 Ollama 官方模型,或者需要使用一个平台上有但 Ollama 官方源没有的模型版本,可以先获取 GGUF 格式权重文件,再用 Modelfile 导入。
假设权重文件路径是/data/models/custom-model.gguf,创建 Modelfile:
FROM /data/models/custom-model.gguf然后创建模型:
ollama create custom-model -f Modelfile导入后就可以像普通模型一样运行。注意 GGUF 文件必须与运行环境匹配,例如量化格式、上下文长度等配置。来源不明的 GGUF 文件存在安全风险,生产环境需要确认文件来源可信。
8. 常见问题完整排查路径
8.1 排查问题的通用顺序
遇到 Ollama 相关异常,不要先怀疑模型有问题。按下面顺序排查,效率更高:
- 确认 Ollama 服务是否在运行。
- 确认命令中的模型名称和标签是否存在。
- 确认磁盘空间是否充足。
- 确认模型存储目录是否可写。
- 确认端口
11434是否被占用。 - 确认修改环境变量后是否重启了服务。
- 确认当前版本是否支持要执行的操作。
- 查看 Ollama 日志中的具体异常。
8.2 问题现象和处理对照表
| 问题现象 | 常见原因 | 处理建议 |
|---|---|---|
ollama --version命令不存在 | 环境变量未配置 | 手动添加 Ollama 安装目录到 PATH |
pull时长时间卡住 | 网络问题 | 中断后重试,利用断点续传 |
| 生成速度特别慢 | CPU 推理,未使用 GPU | 检查 GPU 驱动,确认 Ollama 是否识别 GPU |
| 提示端口被占用 | 其他进程占用 11434 | 换端口或停止占用进程 |
| 模型加载后不久就被自动停止 | 显存或内存不足 | 换更小的模型或减少并发请求 |
| API 请求无响应 | 服务未启动或监听地址不对 | 检查ollama serve和OLLAMA_HOST |
| 修改环境变量后不生效 | 未重启服务 | 退出托盘程序或重启 systemd 服务 |
8.3 显存和内存不足的典型表现
在 8GB 显存的显卡上跑 14B 模型,经常会出现模型加载一半就报错,或推理时系统卡顿。这不是 Ollama 的 bug,而是资源配置不匹配。
处理方式按优先级排列:
- 换更小的模型,例如从 14B 降到 7B。
- 使用量化版本,如
q4_0这种低比特模型。 - 减少并发请求。
- 降低
num_ctx上下文长度。 - 在服务端限制模型可占用的 CPU 内核数。
8.4 模型标签不存在时的报错处理
执行ollama run nonexistent-model时,可能看到类似manifest not found的错误。这表示本地没有该模型,并且远程也没有匹配的标签。
处理方式:
- 检查模型名称拼写。
- 去模型库确认正确的标签格式。
- 先执行
ollama pull 正确标签,再执行ollama run。
8.5 修改默认端口和监听地址
如果11434被其他程序占用,可以修改OLLAMA_HOST环境变量。
Linux 示例:
export OLLAMA_HOST=127.0.0.1:11435 ollama serveWindows 上可以这个环境变量加到系统变量,然后重启 Ollama。修改后,客户端调用地址也要同步改成新端口。
9. 从学习环境到生产环境的最佳实践
9.1 学习阶段怎么做
学习阶段的目标是跑通链路,理解概念。建议按照这个顺序练习:
- 安装 Ollama,确认版本可运行。
- 拉取一个 7B 中文模型,完成一次对话。
- 使用 curl 调用
/api/chat,理解请求和响应的结构。 - 编写 Python 程序调用模型。
- 用 Modelfile 创建一个带自定义系统提示词的模型。
- 手动导入一个 GGUF 文件,理解模型文件的来源和格式。
不要一开始就追求部署 70B 大模型。先把最小链路跑通,再逐步替换成更大模型,排查问题的能力会比盲目追求规模更有价值。
9.2 生产部署必须补齐的安全和控制项
Ollama 提供的是推理能力,而不是完整的业务服务。生产环境不能把 Ollama 直接暴露给公网,至少要补齐以下内容:
- 认证与鉴权。Ollama 默认接口无鉴权,部署到服务器后要放在认证网关后面,或者用反向代理添加 Token 校验。
- 超时与限流。模型推理时间波动大,必须设置合理的请求超时,并对调用方做配额限制,防止单一线程拖垮服务。
- 日志与监控。记录每次请求的模型名称、请求来源、输出 token 数和响应耗时,出现异常时才有排查依据。
- 回滚机制。自定义模型在切换版本时,要保留旧版本镜像,至少保留模型文件备份,避免升级失败。
- 资源告警。关注 CPU、内存、显存和磁盘使用率,模型文件和日志都可能快速占用磁盘。
9.3 扩展方向:从单模型到智能体
跑通 Ollama 只是第一步。2026 年的项目里,更常见的是把本地模型接入到智能体框架中。
常见扩展路径:
- 结合 Dify 或 LangChain 搭建 RAG 应用,把文档向量化后交给大模型回答。
- 使用 Function Calling 能力,让模型根据用户问题调用本地的函数和工具。
- 接入代码编辑器的 AI 插件,把补全请求指向本地 Ollama。
- 把多个开源模型组合使用,例如用一个小模型做意图识别,再用大模型生成复杂回答。
每一步扩展都需要回到本文的基础能力:模型管理、API 调用、参数调优和排错方法。把这些基础打牢,后面的智能体开发才不会踩坑。
收尾:给初学者的一条练习建议
Ollama 的实际使用门槛远低于想象。真正值得花时间研究的不是安装本身,而是模型选择、参数调优、服务治理和应用集成。第一次上手时,挑一个 7B 模型,靠命令和 API 把“对话 - 代码调用 - 自定义模型”这条完整链路走通。之后再根据项目需求换更大模型、加 RAG、接智能体框架,都会顺手很多。本地大模型不是某个特定工具的事,而是一整套工程能力,先从最小闭环开始,比囤积一堆配置片段更有用。