给你一个能直接用的成本决策框架。
先说结论
Hermes 本身是一个框架层工具,它不决定你用什么模型,只负责把模型接进来用。
所以「本地部署 vs 云端 API」这个问题,真正的问题是——在 Hermes 里,你是接本地模型还是接云端 API。
这个选择直接影响你一个月的钱。
先给一个快速结论:
90% 的人用「混合方案」就够了:本地免费模型跑日常,云端付费模型跑复杂任务。月成本控制在 30-50 元,效果不打折。
三种方案对比总览
| 方案 | 月成本 | 适合场景 | 限制 |
|---|---|---|---|
| 云端 API(付费) | 30-300 元/月 | 高质量、复杂任务 | 按量付费,用得越多越贵 |
| 云端 API(免费档) | 0 元/月 | 日常对话、轻量任务 | 有调用次数上限,易限流 |
| 本地模型(Ollama) | 0 元/月(电费) | 隐私敏感、大量调用 | 需要 GPU,响应慢,模型质量看硬件 |
方案一:云端 API(付费)
接 OpenAI、Anthropic、DeepSeek 官方 API。
成本估算(以 DeepSeek V4-Flash 为例,2026年8月峰谷定价后):
| 使用量 | 时段 | 月费估算 |
|---|---|---|
| 每天 100 次对话 | 工作日前高峰 | ~50-100 元 |
| 每天 100 次对话 | 周末低谷 | ~20-40 元 |
| 每天 500 次对话 | 混合时段 | ~200-400 元 |
| 每天 1000+ 次 | 混合时段 | 500 元+ |
优点:质量高、响应快、不用管环境、模型随时可换。
缺点:DeepSeek 涨定价后成本上升明显,高峰期贵一倍。
选哪个云端 API
| 平台 | 优点 | 缺点 |
|---|---|---|
| DeepSeek 官方 | 国内直连、价格低 | 峰谷定价后高峰贵 |
| OpenRouter | 一个 key 通吃多家、有免费模型 | 中间商,价格有溢价 |
| 商汤日日新 | 公测免费 | 限流严重 |
| OpenAI | 质量最高 | 国内直连不了,贵 |
方案二:云端 API(免费档)
接商汤日日新 Token Plan、OpenRouter 免费模型。
| 方案 | 免费模型 | 限制 |
|---|---|---|
| 商汤日日新 | sensenova-6.8-flash-lite、deepseek-v4-flash 等 4 个 | 5 小时窗口,连续调用易 429 |
| OpenRouter | 多个:free后缀模型 | 有调用频率上限,响应慢 |
优点:零成本,Hermes 里配置和付费模型一样。
缺点:限流是硬伤,不适合高频调用场景。
商汤日日新免费模型实测
| 模型 | 适合场景 | 限流情况 |
|---|---|---|
| sensenova-6.8-flash-lite | 文本对话、代码生成 | 宽松,推荐主力 |
| sensenova-6.7-flash-lite | 同上,备用 | 宽松 |
| deepseek-v4-flash | 逻辑推理、复杂任务 | 中等 |
| glm-5.2 | 中文任务 | 容易 429 |
方案三:本地模型(Ollama)
装 Ollama,本地跑模型,Hermes 通过 Ollama 的 API 地址接入。
# 装 Ollamacurl-fsSLhttps://ollama.com/install.sh|sh# 拉模型(推荐 llama3,7B 大小,8GB 显存就能跑)ollama pull llama3# 拉个更大的试试ollama pull mistral:7b然后 Hermes 里配置 provider:
custom_providers:-name:Ollamabase_url:http://localhost:11434/v1api_key:ollamamodels:-llama3-mistral:7b优点:完全免费、无调用限制、数据不出本机、隐私绝对安全。
缺点:需要 GPU(至少 8GB 显存)、响应比云端慢(本地 7B 模型输出速度约 10-20 token/s)、模型质量看硬件和选什么模型。
本地模型推荐
| 模型 | 大小 | 需要显存 | 质量 |
|---|---|---|---|
| llama3:8b | 4.7GB | 6GB+ | 日常够用 |
| mistral:7b | 4.1GB | 6GB+ | 逻辑不错 |
| qwen2:7b | 4.4GB | 6GB+ | 中文好 |
| deepseek-v2:23b | 14GB | 16GB+ | 推理强 |
一年总成本对比
假设每天 200 次对话,一年算下来:
| 方案 | 月均成本 | 年成本 | 质量 |
|---|---|---|---|
| 云端付费(中等量) | 100 元 | 1,200 元 | 高 |
| 云端免费 + 付费补充 | 20 元 | 240 元 | 中 |
| 本地模型(Ollama) | 电费 10 元 | 120 元 | 中(看模型) |
| 混合(本地主力 + 云端补充) | 30 元 | 360 元 | 高 |
我的推荐:混合方案
90% 的人用「混合方案」就够了:
- 主力模型:本地 Ollama(
llama3或qwen2:7b)或商汤日日新免费模型,覆盖日常 80% 的使用 - 复杂任务:切到 DeepSeek / GPT 付费 API,一个月也就几十块
- 定时任务:用免费模型跑,量大也不心疼
配置示例:
model:provider:ollamadefault:llama3custom_providers:-name:Ollamabase_url:http://localhost:11434/v1api_key:ollamamodels:[llama3,mistral:7b]-name:Token.sensenova.cnbase_url:https://token.sensenova.cn/v1api_key:你的keymodels:[sensenova-6.8-flash-lite,deepseek-v4-flash]主力用 Ollama 本地模型,复杂任务临时切商汤日日新的 deepseek-v4-flash。成本控制在 30-50 元/月,效果不打折。
说几句实话
AI 工具的成本结构正在变。
模型侧在涨价——DeepSeek 涨定价,OpenAI 也在涨,趋势很明显。
框架侧在免费——Hermes、DeepSeek Harness、各种 Agent 框架全部开源免费。
Hermes 的价值不在于它便宜,而在于它让你能自由切换模型——贵的用贵的,能免费的地方就免费。
一个能随时换模型的框架,比一个锁定模型的闭源工具,抗风险能力强得多。
想想两年前 DeepSeek 刚出来的时候,所有人都欢呼「AI 便宜了」。现在 V4-Pro 高峰输出 102.2 元/亿 token,两年涨了 6 倍。
但 Hermes 的用户,只是换了一个 provider 配置,成本就回来了。
作者简介:码锅,一个喜欢研究 AI 技术的程序员。
版权声明:本文为作者原创,本文为博主「Hermes Agent 实战系列」第 8 篇。转载需注明出处。