几秒录音克隆出你的声音:OpenVoice 语音克隆指南与本地部署避坑
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
你有一段 10 秒的干净录音,想让它替你念一段新台词?OpenVoice 语音克隆就是干这个的:上传参考音频,它提取音色,再用这个音色合成新内容。本地跑要一块显存 4GB 起步的 GPU;没有卡就用官方在线服务,完全免安装。
谁维护、能不能商用:三句话讲清
- MIT 与 MyShell 联合开源,核心作者来自 MIT 和清华大学。
- V1、V2 都是 MIT 协议,商用免费,2024 年 4 月起生效。
- 官方定位是"技术"不是"产品":它给引擎和权重,稳定封装交给在线服务或你自己。
🚀 先跑通再研究:在线 5 分钟出第一句克隆语音
最省事的验证路径是零安装的在线服务,本地部署放第二步。
打开 MyShell 的 Workshop 建一个 Bot,在 Setting 里打开 Voice (TTS) 开关,再到组件广场 Widget Center 里选 TTS 标签,挑一个基础音色先试听:
回到 Bot 页面点 Create,上传 5~10 秒的干净人声做参考音频,输入要朗读的文字,几秒后就能下载结果。语言入口有英式英语、美式英语、中文、日语、韩语、西班牙语、法语等 9 种,参考音频本身不限语言:
本地最小路径(Linux + GPU,Python 3.9),5 行命令装完:
conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .V1 权重放checkpoints,V2 放checkpoints_v2,然后跑python -m openvoice_app --share起本地 Gradio 页面,浏览器打开就能试。V2 还要补装 MeloTTS 相关依赖,照 使用文档 的 V2 小节来。
🔎 它是怎么做到的:先念词,再换嗓子
一句话:先让基础 TTS 按你指定的风格念出台词,再把音色换成参考人的,语气节奏不动。
整个过程像给影视剧换配音:第一步,"临时配音员"(基础 TTS 模型)按你设定的情感、语调、节奏念完台词;第二步,系统把参考录音压成一枚"声音指纹"(音色特征向量,把一段声音压缩成的可比对特征);第三步,用这枚指纹替换临时配音员的嗓子。念的是你要的内容,听上去像参考的那个人。
效果预期:能做到与做不到对照
| 能做到 | 做不到 |
|---|---|
| 5~10 秒干净人声即可克隆出同音色朗读 | 只搬音色,情感和口音不在克隆范围内 |
| 情感、语调、节奏可与音色独立调节 | 想换口音或情绪,得换基础 TTS 模型,换参考音频没用 |
| V2 原生覆盖中、英、日、韩、西、法 6 种语言,支持跨语言零样本克隆 | 参考音频不达标(噪音、多人、过短)时结果会明显跑偏 |
| 参考音频可以是任意语言 | 基础 TTS 模型不支持的语言无法直接输出 |
🛠 翻车自救:按现象查这份清单
启动就报"找不到模型"
- 现象:跑 Gradio 或 demo,日志提示 checkpoint 加载失败。
- 原因:权重没解压到指定目录。
- 解法:V1 解压到
checkpoints/,V2 解压到checkpoints_v2/,重跑即可。
首次运行卡住,日志停在 Downloading
- 现象:第一次处理音频长时间无响应,日志出现 silero-vad 的下载提示。
- 原因:音色提取脚本
openvoice/se_extractor.py里的人声检测组件首次调用要联网拉模型。 - 解法:断网机器请手动下载 zip,解压放进本机 torch 缓存目录
~/.cache/torch/hub/下对应文件夹。
生成的声音不像、音质发飘
- 现象:克隆结果和参考人差异明显,或有杂音。
- 原因:参考音频不达标,或命中了旧缓存。
- 解法:逐项排查背景噪音、多人同说、时长过短、长静音段;参考文件换个名字,或删掉
processed缓存目录再试。
V2 装完跑不起来
- 现象:主包装好了,V2 的 demo 报缺依赖。
- 原因:V2 额外依赖 MeloTTS 相关组件。
- 解法:按 使用文档 V2 小节的命令补齐后再跑。
显存不足或直接 OOM
- 现象:本地推理起不来,报 CUDA out of memory。
- 原因:推理需要 GPU,显存 4GB 起步。
- 解法:转官方在线服务,或换带卡机器再部署。
什么时候选它:三种人选的选型建议
只想出结果,不想装环境
直接用在线服务,5 分钟内拿到克隆音频。本地那一整套对你是负资产,跳过。
要把克隆嵌进产品或 App
选 OpenVoice 的理由有两点:音色与情感解耦,情绪、节奏能单独控制;MIT 协议,商用零授权成本。V2 还能覆盖 6 种语言,够多数出海产品用。
在同类项目之间对比
只要多语言朗读,纯 TTS 模型更省事。需要"固定音色 + 独立调风格",或者拿中文录音输出日语这种跨语言零样本,开源方案里 OpenVoice 是少数能做的。可先跑 demo_part1.ipynb 看风格控制,再跑 demo_part3.ipynb 看 V2 多语言效果。
收尾:一个值得抄的设计
把音色和风格拆成两条独立流水线,是 OpenVoice 最值得借鉴的思路;只做配音不做模型的话,在线服务加 MIT 协议已经够你当天接入。
延伸阅读:使用文档、常见问题、核心源码
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考