Hermes WebUI 多模型实战:3 步接好云端加本地,一个界面全搞定
【免费下载链接】hermes-webuiHermes WebUI: The best way to use Hermes Agent from the web or from your phone!项目地址: https://gitcode.com/GitHub_Trending/he/hermes-webui
Hermes WebUI 的多模型管理,就是把云端 API 与本地模型收进同一个界面:加一次配置,之后随时换模型,进行中的会话不用中断。全文按"先跑通、再用顺、再兜底"的顺序走,你不需要任何前置经验。
🧭 一、一个界面切模型,不搬对话
这一节帮你省掉来回切窗口、把上下文复制粘贴到下一个工具里的时间。
模型散在几家厂商的官网和终端命令里,换个模型就得开新窗口、把上下文重新交代一遍。Hermes WebUI 把 OpenAI、Anthropic、Gemini、OpenRouter、DeepSeek 等云端服务,连同 Ollama、LM Studio 这类本地(或兼容 OpenAI 接口)的服务,全部放进同一个选择器。
于是:
- 换模型像切选项,不用搬对话;
- 按任务切换,写代码用强模型,日常问答用便宜的;
- 本地模型不用把内容发出去,隐私敏感的任务留在自己机器上跑。
配置只做一次,后面反复受益。
🚀 二、起步:先接 1 个云端,再挂 1 个本地
这一节帮你避开"第一个模型就卡住"的坑,全程 5 分钟内跑通。
云端:向导替你把密钥和默认模型写进配置
第一次打开 Hermes WebUI 会进入设置向导:系统检查 → 选提供商 → 工作区与模型 → 可选密码。OpenRouter、Anthropic、OpenAI 这类快捷提供商只需填 API 密钥、挑一个模型。
本地 Ollama / LM Studio 的 Base URL 怎么填
Base URL 指模型服务对外提供接口的地址,通常以/v1结尾。自托管服务大多不需要密钥,密钥栏留空即可。
常见地址速查:
- LM Studio(与 WebUI 同一台机器):
http://127.0.0.1:1234/v1- Ollama(同一台机器):
http://127.0.0.1:11434/v1- 跑在 Docker 里、服务在宿主机:把上面的
127.0.0.1换成host.docker.internal
保存前,向导会自动去访问<Base URL>/models(模型列表端点)做探测:探测成功,下拉列表当场填满;探测失败,页内会直接告诉你是 DNS 失败、连接被拒、超时还是返回格式不对。列表为空,优先怀疑 Base URL 或密钥,照着报错改,再点测试连接。
💬 三、日常:会话里换模型、管提供商、隔离配置档
这一节帮你避开"切了模型上下文就丢"和"几个项目共用一套配置互相串味"的坑。
切换不丢上下文。聊天输入框下方的模型选择器,列表从各家提供商实时拉取,按提供商分组,每个模型标出配额和可用状态,还支持搜索筛选。选一个新模型,切换立刻生效,已有的对话完整保留。常见动因:当前任务与手头模型不匹配;大模型跑简单活太贵;想要响应更快的小模型。
故障时自动切备用。主模型出问题时,WebUI 会自己处理:请求超时先自动重试;配额耗尽就换同提供商的其他模型;其余 API 错误按错误类型选择恢复路径。前提只有一个——至少再配好一个提供商当备胎。
提供商集中管理。设置面板的 Providers 页就是总管理台:增删改提供商、更新密钥与 Base URL、点测试连接验证配置、查看配额,都在这里完成。
多档配置隔离。配置档(profile)是一份完整独立的配置,每档有自己的模型、提供商与工作区。项目 A 一档、项目 B 一档,互不串味;给同事单独开一档控制权限;想试新模型就开实验档,测坏了删掉即可。切换配置档不会打断正在跑的会话。
📊 四、进阶:自动故障转移、控成本、看用量
这一节帮你避开"烧了多少 token 心里没数"和"主模型挂了只能干等"两个坑。
成本与策略上,有三件事值得做:
- 设预算上限,到达阈值自动降级到更便宜的模型;
- 参考对话内容选模型:代码类任务推强模型,简单问答推便宜模型,低峰期再上强模型;
- 按任务重要性分级分配,重要会话给好模型,批量杂活给小模型。
Insights 页把用量摊开看:分模型、分日期统计 token 消耗、平均响应时间、单会话成本、成功率与错误率;健康监控区盯着可用性、延迟分布、错误率、配额消耗。哪些模型在烧钱、谁在拖慢响应,一眼看穿。
🩹 五、兜底:排障速查、参数调优与会话模板
这一节帮你避开"出问题只能瞎猜"的坑,先自查,再动手。
| 现象 | 优先排查 |
|---|---|
| 模型列表为空 | Base URL 写错、网络不通、密钥缺失 |
| 切换模型失败 | 目标模型配额是否耗尽、会话上下文是否兼容 |
| 响应明显变慢 | 开模型缓存、调并发上限、确认流式已开启 |
参数按模型调。每个模型都能单独设置温度、最大 token 数、频率惩罚与存在惩罚:求稳调低温度,求发散调高。
会话模板省重复劳动。把调好的参数组合存成模板,开新会话直接套用——代码审查低温求稳,创意写作高温求发散。
自定义端点随便接。任何兼容 OpenAI 接口的自研网关都能作为自定义提供商接入:填端点 URL 与认证,测试连接、保存,模型自动出现在选择器里。详见onboarding 文档。
老用户的打法是把模型分三层:便宜款管日常,强模型留给关键任务,备用模型跨提供商各占一席;再配上条件、定时、预算阈值触发的自动切换,以及成本、性能、错误三类告警,多模型体系才算闭环。
今天就做的三步:
- 配 1 个云端提供商 + 1 个本地模型,验证测试连接通过;
- 给当前项目建第 2 个配置档,试一次不串味;
- 设好预算上限和故障转移用的备用提供商。
提醒一句:模型配置一次就长期生效,真正值钱的是按任务分层和设预算这两件事。这两件做了,多模型切换才真正省钱、省事。
【免费下载链接】hermes-webuiHermes WebUI: The best way to use Hermes Agent from the web or from your phone!项目地址: https://gitcode.com/GitHub_Trending/he/hermes-webui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考