用这款免费的实时语音转文字工具,开会走神也不怕了
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
你有没有经历过这样的瞬间:视频会议开到一半,领导突然点名让你总结要点,而你脑子里一片空白;或者上网课老师语速飞快,你奋笔疾书还是跟不上。这时候你需要的,其实是一位永远不下班的"语音速记员"。
今天推荐的TMSpeech,就是一款面向 Windows 的实时语音转文字工具。它把电脑里播放的所有声音实时变成字幕,全程离线语音识别,对话内容不离开你的电脑,隐私完全由自己掌控。而且它轻得惊人——在 AMD 5800u 笔记本上实测,CPU 占用率长期稳定在5% 以下,内存占用不到 500MB,开着它同时打游戏、写代码、看直播,几乎感觉不到它的存在。
痛点直击:为什么你需要一台"字幕机"?
先别急着下载,看看这几个场景里有没有你的影子:
- 视频会议中突然被点名,却想不起刚才讲了什么,尴尬到脚趾抠地
- 外教课、英文讲座听得一知半解,回头想补课却找不到完整记录
- 追更技术教程、产品培训,讲完就忘,笔记永远跟不上
- 头脑风暴时灵感一闪而过,散会后却怎么也想不起来
TMSpeech 就是为这些场景而生的。它甚至允许你"开会时更放心地走神"——名字也正来源于此(原项目描述为"腾讯会议摸鱼工具")。因为它会把每句话都记下来,你需要做的只是事后看一眼历史记录。
三步上手:从下载到出字幕只要三分钟
TMSpeech 不需要安装,解压即用,上手门槛几乎为零:
- 克隆仓库
git clone https://gitcode.com/gh_mirrors/tm/TMSpeech,或从官方 Release 页面下载最新的压缩包 - 解压后双击运行
TMSpeech.exe,首次启动会自动生成配置文件 - 选好音频源和识别模型,点击"开始",字幕立刻出现
主界面是一个无边框的半透明窗口,可以任意拖动、随意调整大小,像歌词字幕一样悬浮在屏幕上。鼠标移到窗口顶部,一排功能按钮会浮现出来:
- 🟥红色计时按钮:显示本次识别已进行多久,红色即代表正在工作中
- 🕐历史记录按钮:随时回看之前识别过的所有内容
- 🔒锁定按钮:把字幕窗口锁定起来,防止误碰误点
- ⚙️设置按钮:进入详细配置,调整识别器、模型、外观等
窗口默认置顶显示,即使电脑静音、完全关闭声音,它依然能正常干活——因为它直接"内录"系统播放的声音,这是它最大的杀手锏。
三招搞定配置:让软件真正懂你
第一招:选对音频源,决定"它听什么"
TMSpeech 的"耳朵"是可以自由切换的,在设置里你至少能看到三种音频源:
| 音频源 | 听什么 | 适合谁 |
|---|---|---|
| 系统音频 | 电脑播放的所有声音(视频会议、网课、视频) | 会议记录、字幕生成,最常用 |
| 麦克风 | 你本人说话的声音 | 个人口述、语音备忘录 |
| 进程音频 | 只捕捉某一个应用程序的声音 | 想排除游戏 BGM 等干扰时 |
想录会议就选系统音频,想录自己就选麦克风,精准又灵活。
第二招:挑选识别器,决定"它怎么听"
打开设置里的"语音识别"页,你会看到多种识别引擎可以一键切换:
- 命令行识别器:面向开发者,可以接入任何第三方识别程序,比如 Whisper 或自研模型,自由度拉满
- Sherpa-Ncnn 离线识别器:支持 GPU 加速,识别速度飞快,适合直播、游戏等对速度要求高的场景
- Sherpa-Onnx 离线识别器:主打 CPU 优化,资源占用低,普通办公电脑首选
对大多数用户,我推荐直接选Sherpa-Onnx 离线识别器——安静省电,识别够准,日常办公绰绰有余。
第三招:安装模型,决定"它听懂什么话"
语音识别要干活,离不开语言模型。在"资源"页面里,你可以像装 App 一样安装和卸载模型:
| 模型 | 大小 | 适用场景 |
|---|---|---|
| 中文模型 | 约 300MB | 中文会议、课程、讲座 |
| 英文模型 | 约 200MB | 英文环境、外语学习 |
| 中英双语模型 | 约 500MB | 混合语言场景、国际会议 |
点击"安装"按钮,稍等片刻即可完成,装好就变成"已安装"状态。想换模型,随时在这里一键切换。
用户安装的模型存放在%AppData%/TMSpeech/plugins/目录下,随时可以删掉重装;内置资源则在应用目录的plugins/文件夹中。
进阶玩法:让开发者也能把玩出花来
TMSpeech 最迷人的地方在于它的插件化架构——核心框架与功能模块完全分离,代码在src/TMSpeech.Core/与src/Plugins/中清晰分层,音频源、识别器、翻译器都可以按需替换。
其中最值得一试的是命令行识别器。它的原理简单得惊人:启动一个子进程,把它的标准输出当字幕,标准错误输出当日志。用单个换行更新当前句子,用连续换行表示一句话结束,你自己写的 Python 脚本就能变成识别引擎。
想直接上手?项目在external_recognizer/目录里放了现成的参考脚本,包括带断句检测的流式识别示例,抄过来改改就能用。这意味着一件事:今天出了一个更好的开源识别模型,明天你就能把它接进 TMSpeech,永远不被某个厂商锁死。
让识别结果变得好用:历史记录与通知
识别出来就完事了吗?当然不止。
所有识别结果默认按日期自动保存到"我的文档"里的TMSpeechLogs文件夹,一篇会议纪要就这样被静默整理好了。在历史记录窗口中,你可以像在聊天软件里一样选中、复制任意一段文字(Ctrl+C复制、Ctrl+A全选),把要点随手粘进你的笔记或周报。
TMSpeech 还支持设置"敏感词通知"——一旦识别内容中出现你设定的关键词(比如你的名字、某个项目代号),它就会弹出通知提醒你。开会走神没听见别人喊你?让软件替你盯着。
遇到问题怎么办:五个常见坑的解法
1. 识别准确率不够高?先换更合适的模型(中英混说就上双语模型),其次保证环境安静、麦克风距离嘴边 10-15 厘米,别在嘈杂背景里硬用。
2. 抓不到系统音频?检查 Windows 声音设置里的"录制"标签页,确保"立体声混音"设备已启用,然后在 TMSpeech 里选它为音频源。
3. CPU 占用偏高?切到 Sherpa-Onnx 识别器,降低识别帧率,或使用更轻量的语言模型。
4. 历史记录找不到?先确认"我的文档"下是否有TMSpeechLogs文件夹,再检查设置里的日志保存路径是否被改过,同时留意磁盘空间是否充足。
5. 搞坏了配置?别慌,运行项目里的重置配置脚本,删掉旧配置重启即可,一切回到出厂状态。
写在最后:把"跟不上"变成过去式
TMSpeech 的价值,在于它把实时语音转文字这件曾经高不可攀的事,做成了"解压即用、离线免费、低占用"的日常工具。它不联网、不收费、不上传你的声音,是一款真正意义上的电脑音频转文字工具免费版,也是一款安静可靠的Windows 实时字幕软件。
如果你已经受够了记笔记的狼狈,现在就可以克隆仓库git clone https://gitcode.com/gh_mirrors/tm/TMSpeech亲手试试。项目是完全开源的,遇到问题可以去提 Issue,有 C# 或 Windows 开发经验的朋友也欢迎贡献代码、推荐更好的模型。社区里每一份反馈,都会让这个工具更懂你的需求。
让字幕替你的耳朵加班,你只管认真生活。😉
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考