如何查看Qwen3-0.6B运行状态?Ollama命令大全
你刚把 Qwen3-0.6B 模型跑起来了,但不确定它到底“活没活”?终端里没报错,可也没见输出;想确认模型是不是真在后台跑着,又怕贸然重启搞崩服务;遇到响应慢、卡顿、不返回结果的情况,却不知道该查哪——别急,这正是本文要解决的问题。
Qwen3-0.6B 是千问系列中轻量但实用的入门级模型,适合在中低配设备(比如 8 核 CPU + 16GB 内存的虚拟机)上快速验证能力。但它不像 Web 应用那样有状态面板,它的“心跳”藏在 Ollama 的命令行世界里。本文不讲怎么部署、不重复下载步骤,只聚焦一个核心目标:让你一眼看清 Qwen3-0.6B 正在干什么、是否健康、资源用得怎么样、出了问题往哪查。所有操作均基于真实终端环境验证,命令即拷即用,无需额外依赖。
1. 确认 Ollama 服务本身是否正常运行
模型再好,也得靠 Ollama 这个“引擎”来驱动。第一步永远是确认底层服务活着、且对外可访问。
1.1 检查进程是否存在
在任意终端窗口执行:
ps aux | grep ollama | grep -v grep如果看到类似以下输出,说明ollama serve进程正在运行:
root 12345 0.0 0.2 1234567 89012 ? Ssl 10:22 0:05 ./ollama serve若无任何输出,则服务未启动。此时需进入 Ollama 安装目录(如/usr/local/bin或你解压的bin/目录),执行:
OLLAMA_HOST=0.0.0.0 ./ollama serve注意:
OLLAMA_HOST=0.0.0.0是关键。它让服务监听所有网卡,而非默认仅限本机(localhost)。没有它,外部工具(如 Chatbox、LangChain 调用)将无法连接。
1.2 验证服务端口是否就绪
Ollama 默认监听11434端口。用curl快速探测其健康接口:
curl -s http://localhost:11434/ | head -n 5正常响应应为 HTTP 200,且返回空内容或简单 HTML(取决于版本)。若提示Connection refused,说明服务未启动或端口被占用。
也可用netstat查看端口占用情况:
netstat -tuln | grep :11434预期输出应包含LISTEN状态,例如:
tcp6 0 0 :::11434 :::* LISTEN1.3 查看实时日志流(最直观的状态窗口)
不要关闭启动服务的终端!那是你的“监控大屏”。Ollama 启动后会持续打印结构化日志,其中每一条都透露关键状态:
Listening on [::]:11434→ 服务已就绪no compatible GPUs were discovered→ 当前使用纯 CPU 推理(符合 Qwen3-0.6B 在普通 VM 的典型场景)inference compute id=0 library=cpu ... available="13.4 GiB"→ 可用内存充足[GIN] ... POST "/api/create"→ 有模型正在加载[GIN] ... POST "/api/chat"→ 正在处理用户请求time=... level=ERROR→ 出现异常(需重点关注)
小技巧:在另一个终端用
tail -f实时追踪日志文件(如果启用了日志写入),但默认情况下,控制台输出就是最及时的状态源。
2. 查看 Qwen3-0.6B 模型是否已加载并运行中
Ollama 把“模型存在”和“模型运行中”严格区分开。ollama list只告诉你模型文件在硬盘上,而ollama ps才告诉你它此刻是否在内存里干活。
2.1 列出所有已加载模型(ollama ps)
这是最核心、最常用的状态命令:
./ollama ps典型输出如下:
NAME ID SIZE GPU EXPIRES STATUS qwen3-0.6b 489740802b4d 639 MB cpu 5m0s running各列含义一目了然:
NAME:模型名称(你创建时指定的qwen3-0.6b)ID:模型唯一标识(用于调试或清理)SIZE:加载到内存的实际大小(非磁盘文件大小)GPU:当前推理设备(cpu表示纯 CPU 模式;若显示cuda或metal,说明 GPU 加速已生效)EXPIRES:自动卸载倒计时(Ollama 默认 5 分钟无请求则释放内存,避免常驻)STATUS:最关键字段——running表示模型正活跃响应请求;loading表示首次调用时正在加载权重;若长时间卡在此状态,大概率是内存不足或 GGUF 文件损坏。
如果
STATUS显示loading且超过 60 秒无变化,请立即检查系统内存:free -h。Qwen3-0.6B 在 Q8_0 量化下仍需约 1.2GB 内存加载,若可用内存 < 2GB,极易卡死。
2.2 对比:ollama listvsollama ps
| 命令 | 作用 | 是否反映实时运行状态 | 示例场景 |
|---|---|---|---|
./ollama list | 查硬盘上有哪些模型文件 | 否(静态列表) | 确认模型是否已成功create |
./ollama ps | 查内存中哪些模型正在工作 | 是(动态快照) | 判断“为什么我发请求没反应?” |
执行./ollama list你会看到:
NAME ID SIZE MODIFIED qwen3-0.6b:latest 489740802b4d 639 MB 2 hours ago这只能证明模型“存在”,不能证明它“在线”。务必养成ollama ps优先的习惯。
3. 深度诊断:当 Qwen3-0.6B 响应异常时查什么
响应慢、不返回、中途断开……这些不是玄学,而是有迹可循的信号。下面按排查优先级列出关键检查点。
3.1 检查 CPU 和内存实时占用
Qwen3-0.6B 在 CPU 模式下是典型的计算密集型任务。用htop(推荐)或top观察:
htop重点关注:
- CPU%:单核是否长期 100%?多核总和是否接近
N × 100%(N 为逻辑核数)? - MEM%:内存使用率是否 > 90%?
- SWAP:是否开始使用交换分区?(出现
Swp列高亮即危险信号)
真实案例:在 8 核 VM 上运行 Qwen3-0.6B,
htop中可见 8 个线程持续满载(CPU%总和达 768%),内存占用稳定在 1.8GB 左右。这是健康状态。若 CPU 长期 < 20%,反而说明模型未真正触发推理(可能 API 调用路径错误)。
3.2 检查模型加载日志细节
回到ollama serve终端,搜索关键词:
loading model:确认模型是否完成加载compute graph/graph built:表示推理图构建成功kv cache size:显示 KV 缓存分配量(与num_ctx参数相关)out of memory/OOM:直接定位内存崩溃根源
若发现failed to allocate memory for kv cache,说明num_ctx设得过大(如设为 8192),需在 Modelfile 中调低至2048或1024。
3.3 验证 API 调用链路是否通畅
用curl模拟一次最简请求,绕过所有客户端(Chatbox/LangChain),直击 Ollama API:
curl -X POST http://localhost:11434/api/chat \ -H "Content-Type: application/json" \ -d '{ "model": "qwen3-0.6b", "messages": [{"role": "user", "content": "你好"}], "stream": false }' | jq '.message.content'成功响应:返回
"你好!我是通义千问,由通义实验室研发的大语言模型..."
失败响应:返回{"error":"model not found"}(模型名拼错)、{"error":"context length exceeded"}(输入超长)、或超时无响应(服务假死)
此命令是排除“是模型问题还是调用方问题”的黄金标准。
4. Ollama 核心命令速查表(含 Qwen3-0.6B 专用说明)
以下命令按使用频率排序,每条均标注适用场景与 Qwen3-0.6B 特别注意事项。
4.1 基础运维命令
| 命令 | 作用 | Qwen3-0.6B 注意事项 |
|---|---|---|
./ollama -v | 查看 Ollama 版本 | 确保 ≥ v0.11.6(旧版对 Qwen3 的模板支持不全) |
./ollama --help | 查看全部命令帮助 | 重点看ps,list,rm,run四个子命令 |
./ollama serve | 启动服务 | 务必加OLLAMA_HOST=0.0.0.0前缀,否则外部不可达 |
./ollama ps | 查运行中模型 | 每日必查,确认STATUS为running |
4.2 模型管理命令
| 命令 | 作用 | Qwen3-0.6B 注意事项 |
|---|---|---|
./ollama list | 列本地所有模型 | 检查NAME是否为qwen3-0.6b:latest(注意冒号和 latest) |
./ollama run qwen3-0.6b "你好" | 交互式问答 | 首次运行会触发加载,等待 10~30 秒属正常;若卡住,立即Ctrl+C并查ollama ps |
./ollama rm qwen3-0.6b | 删除模型 | 删除后需重新create,不会删除 GGUF 文件 |
./ollama create qwen3-0.6b -f /path/to/Modelfile | 从 Modelfile 创建模型 | 路径必须为绝对路径;Modelfile中FROM行必须指向.gguf文件(非文件夹) |
4.3 高级调试命令
| 命令 | 作用 | Qwen3-0.6B 注意事项 |
|---|---|---|
./ollama show qwen3-0.6b | 显示模型元信息 | 查看template是否匹配 Qwen3 的 `< |
OLLAMA_DEBUG=1 ./ollama serve | 启用调试日志 | 日志量暴增,仅用于定位loading卡死等深层问题 |
OLLAMA_NUM_PARALLEL=1 ./ollama serve | 限制并发数 | 在低配机器上可防 CPU 过载导致服务僵死 |
关键提醒:所有
./ollama xxx命令,必须在 Ollama 的bin/目录下执行,或确保./ollama在$PATH中。切勿在模型文件夹内误执行ollama(它会尝试创建新模型)。
5. LangChain 调用时的状态映射(对接开发场景)
如果你用 LangChain 代码调用 Qwen3-0.6B,终端看不到ollama ps那么直观,但可通过代码行为反推状态。
5.1 正常调用流程对应的状态信号
from langchain_openai import ChatOpenAI chat_model = ChatOpenAI( model="qwen3-0.6b", # ← 名称必须与 `ollama list` 输出完全一致 base_url="http://your-server-ip:11434/v1", # ← IP 必须可达,端口必须是 11434 api_key="EMPTY", temperature=0.7, ) response = chat_model.invoke("你好") # ← 此行会触发 Ollama 的 /api/chat 请求response成功返回 →ollama ps中EXPIRES时间重置为 5m,STATUS保持runningresponse返回极慢(>30秒)→ 检查htop中 CPU 是否满载,或ollama ps中STATUS是否为loading- 抛出
ConnectionError→ollama serve未运行,或base_url地址/端口错误 - 抛出
BadRequestError: model not found→model=参数名与ollama list不匹配(如写成qwen3-0.6B大小写错误)
5.2 流式响应(streaming)下的状态观察
启用streaming=True时,Ollama 会分块返回 token。此时ollama ps的EXPIRES不会重置,直到流结束。这是设计使然,不必担心“过期”。
6. 常见问题速解(Qwen3-0.6B 专属)
6.1 问题:ollama ps显示loading,但一直不变成running
原因与解法:
- 内存不足:
free -h查可用内存,确保 > 2.5GB;降低num_ctx至1024 - GGUF 文件损坏:重新从 ModelScope 下载
Qwen3-0.6B-Q8_0.gguf,校验 SHA256 - Modelfile 路径错误:
FROM行必须是./xxx.gguf(相对路径)或/full/path/xxx.gguf(绝对路径),不能是文件夹
6.2 问题:能ollama run,但 LangChain 调用返回空或报错
检查清单:
base_url中的 IP 是服务器真实 IP(非localhost),且防火墙放行11434端口model=字符串与ollama list输出逐字符一致(包括:latest后缀)extra_body中enable_thinking等参数仅适用于特定 API 端点,LangChain 默认不传,无需添加
6.3 问题:响应速度慢,每秒只输出 2~3 个字
优化方向:
- 确认
ollama ps中GPU列为cpu→ 这是预期行为,Qwen3-0.6B 在 CPU 上本就如此 - 关闭其他 CPU 密集型进程(如浏览器、IDE)
- 在 Modelfile 中尝试
PARAMETER num_threads 8(设为逻辑核数)
7. 总结:建立你的 Qwen3-0.6B 健康检查 SOP
运维一个本地大模型,不需要复杂仪表盘,只需三步日常检查,即可掌控全局:
- 启动后第一件事:执行
./ollama ps,确认STATUS为running,EXPIRES在倒计时 - 每次调用前:用
curl快速测试 API 连通性(curl -s http://ip:11434/api/chat) - 响应异常时:打开
ollama serve终端,盯住日志流,搜索error、loading、OOM
Qwen3-0.6B 的价值不在于参数多大,而在于它足够轻、足够稳、足够透明——所有状态都通过标准命令暴露给你。掌握这些命令,你就拥有了对模型运行状态的完全掌控力,不再被黑盒所困。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。