实时屏幕翻译工具 Translumo 入门:一条主线带你把屏幕外语变成中文
【免费下载链接】TranslumoAdvanced real-time screen translator for games, hardcoded subtitles in videos, static text and etc.项目地址: https://gitcode.com/gh_mirrors/tr/Translumo
某个周六晚上,我打开了一款刚打折的独立游戏——它的对话只有英文字幕,没有中文选项。前面十分钟我还能靠半吊子英语硬读,到关键抉择时彻底卡住:任务指向、道具说明、选项背后的含义全靠猜。试过切出去截图、再用在线翻译逐句翻,翻完一行回来,剧情气氛已经凉透了。那晚之后我找到了 Translumo——一款开源的实时屏幕翻译工具,它持续识别屏幕上选定的文字区域,调用多引擎把内容翻译成你的语言,结果直接浮在原画上方。这篇文章就是我从装到用的完整路径,按着走,你也能在十分钟内让它跑起来。
它凭什么值得装:把"翻译"从打断流程的事,变成背景里的事
先说说传统做法有多折腾。你正在玩游戏、看视频或盯一份外语软件界面,遇到看不懂的文字,流程是:暂停 → 切窗口 → 截图或手打 → 打开翻译网站 → 粘贴 → 看结果 → 切回去。一次至少二十秒,情绪中断,来回切换还容易让游戏卡顿或弹窗。
Translumo 把这条路改成了:框一个区域 → 按一下启动 → 之后的文字变化自动识别、自动翻译、自动显示。它不打断你在做的事,翻译结果作为一层悬浮文字盖在屏幕原位置附近,你抬头就能看到。
| 对比项 | 传统"截图+翻译" | Translumo |
|---|---|---|
| 单次耗时 | 约 20 秒以上 | 秒级,且全程不切窗口 |
| 需要手动操作 | 每次都要复制粘贴 | 启动后自动持续工作 |
| 翻译结果 | 显示在另一个窗口 | 悬浮在屏幕原位置附近 |
| 流程打断 | 频繁中断 | 几乎无感 |
它的核心工作方式是一条流水线:抓取屏幕上你框选的区域 → 交给 OCR 文字识别引擎读出原文 → 交给翻译服务翻译 → 把结果画回屏幕。官方推荐在日常场景下只开 Windows OCR 引擎,配合 DeepL 翻译,既能保证速度,也不吃太多资源。
一条主线打通从零到会:先让它跑起来,再谈优化
新手最容易犯的错是一上来就研究所有选项。其实只需要七步,走完就能用,剩下的后面再补。
第一步:拿到软件
最简单的方式是直接下载发布包,解压后运行里面的Translumo.exe即可,不用装任何依赖。想自己动手编译的开发者,可以用下面的命令拉取源码:
git clone https://gitcode.com/gh_mirrors/tr/Translumo编译过程会自动下载 OCR 模型和 Python 组件,体积约 400MB,首次构建请保持网络稳定。
第二步:打开设置并确认语言
程序启动后驻留在系统托盘,按Alt+G打开设置窗口。在语言选项卡里做两件事:把"源语言"设成你屏幕上文字的语言(如英语),把"目标语言"设成你想要的结果(如简体中文)。这两项是它工作的基础,设反了会出现"识别得出来但翻不出来"的怪现象。
第三步:只勾选一个 OCR 引擎
OCR 是"光学字符识别"的缩写,通俗说就是让电脑"看"屏幕上的字。在识别引擎设置里,初期只需要勾选Windows OCR一项。它由系统自带、速度快、对游戏和界面文字的支持好。Tesseract 和 EasyOCR 是早期版本留下的引擎,前者偏老偏慢,后者对显卡和内存要求苛刻,入门阶段先别碰。
第四步:框选识别区域
按Alt+Q,屏幕上会出现一个框选工具,用鼠标拖出你希望翻译的区域。规则很简单:框得越紧越好。只框住文字本身,别把背景、角色、图标一起框进去,框得越小,识别越快、误读越少。
第五步:记住五个核心快捷键
| 快捷键 | 作用 | 什么时候用 |
|---|---|---|
| Alt+G | 打开/关闭设置 | 改配置时 |
| Alt+Q | 框选识别区域 | 换翻译对象时 |
| ~(波浪键) | 开始/停止翻译 | 日常开关 |
| Alt+T | 显示/隐藏翻译窗口 | 结果被遮挡时 |
| Alt+Y | 显示当前识别区域框 | 排查问题时 |
第六步:按下波浪键试跑
按~启动翻译,屏幕上应该出现跟随区域内容变化的翻译文字。改一下画面内容(比如让游戏角色说一句新台词),翻译文字跟着变,就说明整个流水线通了。如果没反应,先用Alt+T把翻译窗口切回最上层,再看下一步避坑清单。
按人群组织用法:不同目的,不同配置
基础跑通之后,配置要围绕你的实际用途微调。下面按四类常见用户给出最贴合的核心设置。
游戏玩家:低延迟优先
- 把游戏设置成无边框窗口或窗口模式,别用独占全屏,否则翻译悬浮层可能被压在游戏画面底下。
- 识别区域只框对话框/任务栏文字,不框整个屏幕。
- 若翻译窗口偶尔被游戏盖住,按Alt+T让它重新置顶。
- 想少打扰又不想完全关闭时,可用Shift+F做一次性的"单次翻译":按一下只翻当前一帧,适合剧情对话这种非持续场景。
追剧党:字幕区的救法
- 面对硬字幕视频(字幕被烧录在画面里、无法提取文本),把识别区域固定框在字幕所在的一横条上,越小越好。
- 开启"识别后自动清空文本"选项,避免上一条字幕残留在翻译窗口里影响阅读。
- 字号和行距可以在设置里调大,视频翻译看久不累;这些显示参数在 ChatWindowConfiguration.cs 里能看到默认值(黑底白字、字号 15、背景透明度 0.65),跟着改就行。
学习者:跟着读的双语朗读
- 源语言设为目标外语,目标语言设成你的母语,用于对照。
- 在语音合成设置里打开TTS 朗读,可选择系统自带 Windows 语音或 Silero 语音引擎,听发音和看译文一起进行。
- 翻译窗口的字体、颜色、加粗都可以调,配合高对比度背景让文字在任意画面上都清晰可读。
办公族:界面的临时汉化
- 遇到没有中文版的软件,框选按钮、菜单所在的区域即可获得即时翻译。
- 翻译服务优先选DeepL,它在术语和句子结构上质量最稳;日常泛用可选 Google Translate,覆盖面更广。
- 需要多个区域来回切换时,重新按Alt+Q换框就行,不必重启程序。
避坑清单:翻车现场 vs 正确做法
这四类问题我基本都踩过,对照排查能省不少时间。
| 翻车现场 | 正确做法 |
|---|---|
| 启动翻译后完全没反应,或提示"Failed to capture screen" | 确认目标窗口处于激活状态;若还不行,重启程序或重开目标窗口 |
| OCR 识别结果乱码、缺字 | 把识别区域框得更小更贴紧文字;检查程序路径是否包含中文或特殊字符(Tesseract 引擎对全英文路径更友好) |
| 翻译请求频繁失败、超时 | 在"语言 → 代理"里配置 1~2 个 IPv4 代理,应用会轮流换 IP 请求,降低被限流概率;也可以降低翻译触发频率 |
| 机器卡顿、风扇狂转 | 只保留 Windows OCR 一个引擎,不要同时勾选多个;缩小识别区域;关闭不必要的界面特效 |
| 游戏画面下看不见翻译窗口 | 确认游戏是无边框/窗口模式;按Alt+T重新置顶翻译窗口 |
兼容性方面再提醒一句:Windows 版本需在 Windows 10 2004(build 19041)及以上或 Windows 11,显卡需支持 DirectX 11;要用 EasyOCR 的话需要 NVIDIA 显卡、CUDA 支持、8GB 以上内存和至少 5GB 磁盘空间——这也是为什么前面建议新手绕开它。
进阶彩蛋:三个新手大概率不知道的隐藏功能
手柄也能控翻译。项目的快捷键配置里内置了一整套手柄(XInput)按键映射,你可以把开始翻译、框选区域、显示窗口这些操作绑到手柄组合键上,适合躺在沙发上用电视玩游戏的场景。映射定义在 HotKeysConfiguration.cs,打开就能看到所有可绑定的动作。
Shift+F 单次翻译在默认配置里是开着的,但它藏在快捷键列表里没人注意。它适合"不需要持续翻译、只想偶尔瞄一眼"的场景,比如看不懂某个按钮时按一下,翻译完就安静待着,比一直开常驻翻译省资源。
多引擎并行 + 智能打分。虽然推荐日常只用 Windows OCR,但如果遇到很花哨的艺术字体识别不出来,可以临时加开一个引擎:它会把多个引擎的识别结果交给一个机器学习模型打分,自动选出最像原文的结果,而不是简单拼装。牺牲一点速度换更稳的准确率,只在需要时开。
从这一步开始
总结成一条可执行的路径:下载安装 → 按 Alt+G 设好语言 → 只勾 Windows OCR → 按 Alt+Q 框选目标区域 → 按 ~ 启动 → 遇到问题对照上面的避坑表逐项排查 → 再按你的用途微调人群配置。走完这条线,你就不再需要在一堆外语窗口和翻译网站之间来回切换了。想深入研究的读者,可以从 src/Translumo.OCR 看三种识别引擎的实现,或从 src/Translumo.Translation 看四种翻译服务的接入方式。工具已经开源在仓库里,现在就下载试试,下一句看不懂的台词,可能就是它帮你念出来的。
【免费下载链接】TranslumoAdvanced real-time screen translator for games, hardcoded subtitles in videos, static text and etc.项目地址: https://gitcode.com/gh_mirrors/tr/Translumo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考