OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
先说结果:你只需要一段十几秒的录音,OpenVoice 就能把任意 TTS 的声音"偷换"成你的音色——说话人还是那个人,听感却已经变成你本人。它是 MIT 与 MyShell 开源的即时语音克隆(Instant Voice Cloning)音频基础模型,无需训练、无需 GPU,参考音频支持任意语言,克隆出的声音还能跨语言输出。MIT 许可证,商用免费。
下面按"能干什么 → 怎么搭环境 → 三步出效果 → 原理速览 → 效果不好的排查"的顺序讲,全程不需要你懂深度学习。
它能帮你做什么?
一句话:换音色,不改内容,不改语言。
- 音色克隆:给一段干净的人声,OpenVoice 提取其"音调颜色"(tone color),生成音频听起来就是这个人。
- 风格可控:口音、情绪、节奏、停顿、语调由底层 TTS 说话人模型决定,你可以按需切换,而不是被参考音频锁死。
- 跨语言克隆:参考音频说中文,生成日语、英语、法语都可以;V2 原生支持英、西、法、中、日、韩六种语言。
- V2 音质更好:相比 V1,V2 换了一套训练策略,输出更自然。
典型用途:给自己做专属语音助手、给小说/播客配自己的声音、给视频换配音、测试 TTS 产品的音色方案。
环境准备:只有两条命令
本地跑需要 Linux 环境、Python 3.9 和 PyTorch 基础,依赖清单见 requirements.txt。
git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice && pip install -e .之后把对应版本的 checkpoint 下载到checkpoints(V1)或checkpoints_v2(V2)目录,具体下载地址在 docs/USAGE.md 的 "Linux Install" 一节里。装完可以直接打开根目录下的demo_part1.ipynb(风格控制)、demo_part2.ipynb(跨语言克隆)、demo_part3.ipynb(V2 用法)三个示例 Notebook 验证环境,也可以跑python -m openvoice_app --share起一个本地 Gradio 界面。
三步出效果:用 Workshop 克隆你的声音
不用写代码的体验路径是 Workshop 界面,三步走:
Step 1:进入 Workshop 创建一个 Bot。这是承载你克隆声音的容器,创建后进入它的 Setting 页。
Step 2:从 Widget Center 挑一个 TTS 模型。在 Widget Center 按语言筛选(TTS → English / Chinese / Japanese…),每个卡片点一下就能试听。记住这个模型——它决定输出音频的口音和情绪,克隆的只是音色。
Step 3:上传参考音频,点击 Create 生成你的克隆声音。在 Voice (TTS) 设置区点 Create,选"通过语音克隆创建",上传一段你自己的录音即可。建议:单人口播、无背景音乐、无长时间静默、时长 10 秒以上,效果会明显更好(参考素材可直接用仓库里的resources/example_reference.mp3)。
幕后原理:60 秒速览
拆开看就是一条流水线:
- 文本 + 风格参数(口音、情绪、语调)先送进基础说话人 TTS 模型,产出一段"替身声音";
- **Tone color extractor(音调提取器)**同时分析你的参考音频,抽出纯音色特征;
- 替身声音经 Encoder / Flow 分解后,把音色维度替换成参考人的,其余风格特征原样保留;
- 经 Flow⁻¹ / Decoder 合成最终音频。
关键就一句话:它只换音色,不换口音和情绪。所以"生成语气不像"不是 Bug——想让语气像,就换一个语气相近的基础说话人模型,或调整风格参数。
效果不对时,先查这五件事
质量不达标 90% 出在参考音频上,按顺序排查:
- 有背景噪音?换成干净录音,效果立竿见影。
- 太短?太短的音频提取不稳定,10 秒起。
- 多人说话?必须单人音频。
- 有大段静音?长静默段会干扰提取,剪掉。
- 重名缓存?换了同名的参考音频但没删
processed目录,程序会复用旧处理结果,删掉重来。
口音/情绪不像、语言支持、Silero 下载失败等问题,仓库里的 docs/QA.md 有逐条解答;想深入看跨语言用法,直接跟demo_part2.ipynb走一遍。
下一步建议:先用 V2 的示例 Notebook 跑通一条音频听感对比,再考虑是否要接自己的基础说话人模型做定制口音。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考