OpenHuman 语音功能怎么开启:语音转文字、文字转语音与 Google Meet 实时会议助手
【免费下载链接】openhumanOpenHuman is an open source personal AI for Mac, Windows and Linux — local-first memory, agent orchestration, and deep research.项目地址: https://gitcode.com/GitHub_Trending/op/openhuman
OpenHuman 的语音能力(STT 语音转文字、TTS 文字转语音、Google Meet 会议代理)是内置核心功能,不是第三方插件。这篇文章面向已经在 macOS、Windows 或 Linux 上安装好 OpenHuman 并登录的用户,说明如何开启并使用这三块语音功能:用快捷键进行语音听写、让代理用语音读回回复、以及让代理以真实参与者身份加入 Google Meet 会议。
完成后的结果:你可以按住快捷键说话,文字实时出现在输入框里;代理的回复可以被你选定的声音朗读出来;加入 Google Meet 后,会议实时转写写入本地 Memory Tree,代理还能通过会议麦克风把语音说进会议里。
前提:系统权限
语音功能依赖两个 OS 权限,第一次启动 OpenHuman 时系统会弹出授权提示:
- macOS:Accessibility(辅助功能)权限;
- 语音快捷键需要 Input Monitoring(输入监控)权限。
这些权限可以随时在Settings中重新查看和调整。如果授权缺失,全局快捷键(比如 push-to-talk)无法注册,这是语音功能"没反应"最常见的原因。
开启语音转文字(STT)
STT 在 voice.md 中描述的完整能力包括:
- Hotkey:支持 push-to-talk(按住说话)和 toggle(开关)两种模式;
- Audio capture:跨平台麦克风采集,带语音活动检测;
- Streaming transcription:边说边出字;
- Hallucination filter:过滤常见的转录伪影(如 "Thanks for watching" 等静默诱发的短语);
- Postprocess:补标点、首字母大写、听写文本清理。
听写结果有两个去向:直接替换桌面当前活动文本输入框的内容,或发送进与代理的聊天。
在 Voice 设置面板中配置
打开Settings → Voice(应用内路由为/settings/voice,面板实现见 VoicePanel.tsx)。这个面板可以完成几类配置:
- STT 路由:选择转写引擎,包括默认的云端(后端代理)方案、本地方案和外部 BYOK 服务商(如 Deepgram、ElevenLabs、OpenAI)。切换到外部服务商时需要填入 API key,默认模型在面板内预设(例如 OpenAI 的
whisper-1)。 - PTT 设置:
/settings/voice面板内嵌了 PttSettingsPanel,管理 push-to-talk 快捷键、是否朗读代理回复(Speak agent replies)以及是否显示悬浮 overlay。 - Always-on 监听:面板提供 always-on 开关,开启后显示常驻监听 HUD(notch)。
保存成功后面板会显示Voice settings saved.提示。
验证 STT 是否可用
- 按住已注册的 PTT 快捷键说话,输入框内应实时出现转录文字(streaming transcription);
- 如果快捷键与已有的听写快捷键冲突,注册会失败并返回
ConflictsWithDictation(<shortcut>),设置面板会把它显示为冲突错误(来源:tauri-shell.md); - 已知边界:快捷键注册在 Wayland 环境或 macOS 缺少 Accessibility 权限时会被系统拒绝,面板会返回对应错误信息。此时先按上一节补授权,再回到设置面板重新注册快捷键。
开启文字转语音(TTS)
TTS 走的是托管 TTS 模型:代理的回复会被朗读出来,声音可按用户配置选择,吉祥物(mascot)头像会通过 viseme map 对音频流做口型同步(详见 mascot 文档)。
开启步骤:
- 在Settings → Voice面板中选择 TTS 引擎与音色。面板内建了一组 Piper 本地音色预设(如
en_US-lessac-medium、en_US-amy-medium、en_GB-alan-medium等,覆盖美式/英式、男女声的medium/high档位),也支持自由输入其他音色名; - 在聊天界面的 mascot 舞台上打开Speak replies out loud开关(实现见 ChatMascotStage.tsx),代理的回复即会被朗读;回复播放到一半时关掉该开关会停止正在播放的音频并清空队列;
- 保存后同样以
Voice settings saved.提示确认。
如果走的是本地 Piper 引擎,面板内有独立的安装与状态轮询流程(安装中状态每 2 秒刷新一次状态,直到安装完成)。
验证方式:发一条消息,确认扬声器播放出语音、吉祥物口型与语音同步。注意 TTS 音频是流式生成并直接丢弃的,不会留存在磁盘上。
使用 Google Meet 实时会议助手
这是 OpenHuman 的旗舰语音集成,工作方式(来自 voice.md):
- 加入会议:通过 OpenHuman 内嵌的 webview 加入 Google Meet(OpenHuman 自带 CEF 运行时来承载这类嵌入式 Web 应用,Google Meet 是受支持的 provider 之一,见 cef.md);
- 实时转写:把会议音频流推给 STT,实时转写会议中所有人的发言,并把结构化笔记写进 Memory Tree;
- 开口说话:当你要求它发言、或它判断自己有价值补充时,通过 TTS 生成音频,并作为 outbound camera/mic 流播回会议——其他参会者能真正听到它。会议中它会以吉祥物摄像头画面作为"参会人"出现(CEF 文档描述了该 fake-camera 通路的实现)。
会议使用的模型走 Automatic Model Routing 的hint:fast低延迟会话路由(voice.md 的 See also 一节)。
验证方式:会议结束后打开Memory标签页查看 Memory Tree,应能看到会议转写与笔记(与 getting-started.md 中"Memory tab 出现 summaries"的同一检查逻辑)。
隐私边界
voice.md 给出的隐私说明如下,与语音功能开启方式直接相关:
- 音频采集在本地完成;流式 STT 经由 OpenHuman 后端,实时转写之外不保留录音;
- TTS 音频流式播放后即丢弃,不存储;
- 会议转写写入你本地的 memory tree,与其他数据源一样留在本机。
下一步
- 想换模型运行方式(云端托管 vs 本地模型),Custom 引导流程中可以选择推理提供方、语音、集成等,见 personal-assistant.md;
- 本地模型下 STT/TTS 的具体分工(后端代理转写 + 托管 TTS)见 local-ai.md;
- 权限、快捷键注册等底层行为可参考 tauri-shell.md 的 PTT 一节。
【免费下载链接】openhumanOpenHuman is an open source personal AI for Mac, Windows and Linux — local-first memory, agent orchestration, and deep research.项目地址: https://gitcode.com/GitHub_Trending/op/openhuman
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考