news 2026/9/1 14:27:41

OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的

OpenVoice 语音克隆教程:3 步把 AI 的声音换成你自己的

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

先说结果:你只需要一段十几秒的录音,OpenVoice 就能把任意 TTS 的声音"偷换"成你的音色——说话人还是那个人,听感却已经变成你本人。它是 MIT 与 MyShell 开源的即时语音克隆(Instant Voice Cloning)音频基础模型,无需训练、无需 GPU,参考音频支持任意语言,克隆出的声音还能跨语言输出。MIT 许可证,商用免费。

下面按"能干什么 → 怎么搭环境 → 三步出效果 → 原理速览 → 效果不好的排查"的顺序讲,全程不需要你懂深度学习。

它能帮你做什么?

一句话:换音色,不改内容,不改语言。

  • 音色克隆:给一段干净的人声,OpenVoice 提取其"音调颜色"(tone color),生成音频听起来就是这个人。
  • 风格可控:口音、情绪、节奏、停顿、语调由底层 TTS 说话人模型决定,你可以按需切换,而不是被参考音频锁死。
  • 跨语言克隆:参考音频说中文,生成日语、英语、法语都可以;V2 原生支持英、西、法、中、日、韩六种语言。
  • V2 音质更好:相比 V1,V2 换了一套训练策略,输出更自然。

典型用途:给自己做专属语音助手、给小说/播客配自己的声音、给视频换配音、测试 TTS 产品的音色方案。

环境准备:只有两条命令

本地跑需要 Linux 环境、Python 3.9 和 PyTorch 基础,依赖清单见 requirements.txt。

git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice && pip install -e .

之后把对应版本的 checkpoint 下载到checkpoints(V1)或checkpoints_v2(V2)目录,具体下载地址在 docs/USAGE.md 的 "Linux Install" 一节里。装完可以直接打开根目录下的demo_part1.ipynb(风格控制)、demo_part2.ipynb(跨语言克隆)、demo_part3.ipynb(V2 用法)三个示例 Notebook 验证环境,也可以跑python -m openvoice_app --share起一个本地 Gradio 界面。

三步出效果:用 Workshop 克隆你的声音

不用写代码的体验路径是 Workshop 界面,三步走:

Step 1:进入 Workshop 创建一个 Bot。这是承载你克隆声音的容器,创建后进入它的 Setting 页。

Step 2:从 Widget Center 挑一个 TTS 模型。在 Widget Center 按语言筛选(TTS → English / Chinese / Japanese…),每个卡片点一下就能试听。记住这个模型——它决定输出音频的口音和情绪,克隆的只是音色。

Step 3:上传参考音频,点击 Create 生成你的克隆声音。在 Voice (TTS) 设置区点 Create,选"通过语音克隆创建",上传一段你自己的录音即可。建议:单人口播、无背景音乐、无长时间静默、时长 10 秒以上,效果会明显更好(参考素材可直接用仓库里的resources/example_reference.mp3)。

幕后原理:60 秒速览

拆开看就是一条流水线:

  1. 文本 + 风格参数(口音、情绪、语调)先送进基础说话人 TTS 模型,产出一段"替身声音";
  2. **Tone color extractor(音调提取器)**同时分析你的参考音频,抽出纯音色特征;
  3. 替身声音经 Encoder / Flow 分解后,把音色维度替换成参考人的,其余风格特征原样保留;
  4. 经 Flow⁻¹ / Decoder 合成最终音频。

关键就一句话:它只换音色,不换口音和情绪。所以"生成语气不像"不是 Bug——想让语气像,就换一个语气相近的基础说话人模型,或调整风格参数。

效果不对时,先查这五件事

质量不达标 90% 出在参考音频上,按顺序排查:

  • 有背景噪音?换成干净录音,效果立竿见影。
  • 太短?太短的音频提取不稳定,10 秒起。
  • 多人说话?必须单人音频。
  • 有大段静音?长静默段会干扰提取,剪掉。
  • 重名缓存?换了同名的参考音频但没删processed目录,程序会复用旧处理结果,删掉重来。

口音/情绪不像、语言支持、Silero 下载失败等问题,仓库里的 docs/QA.md 有逐条解答;想深入看跨语言用法,直接跟demo_part2.ipynb走一遍。

下一步建议:先用 V2 的示例 Notebook 跑通一条音频听感对比,再考虑是否要接自己的基础说话人模型做定制口音。

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 14:26:32

C#离线OCR工具实战:基于PaddleOCR的本地文字识别方案

简介:这是基于PaddleOCR的C#本地离线OCR解决方案,面向需要在Windows桌面应用中识别图片文字、且不希望依赖云端服务的开发者。程序实现了鼠标点击定位取词,可对图片进行缩放,并能通过输入编号获取指定位置文字,适用于截…

作者头像 李华
网站建设 2026/9/1 14:16:06

基于SpringBoot的咖啡厅管理系统(源代码+文档+PPT+调试+讲解)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

作者头像 李华
网站建设 2026/9/1 14:15:18

奇安信C++春招真题复盘:从内存管理到并发与算法核心考点

2023年奇安信春招C方向的那套试卷,在朋友圈里被讨论过好几轮。作为当时也在筹备C岗位面试的人,我特意把这套卷子里里外外拆了一遍,今天把一些核心考点和做题思路整理出来。这套卷子表面上看是常规的C八股加算法题,但仔细研究会发现…

作者头像 李华
网站建设 2026/9/1 14:15:05

赛事预测算法实战:从梯度提升树到泊松蒙特卡洛模拟

看到“8月11欧冠比赛算法分析预测”这类需求,很多人的第一反应是:找到某个公式,输入两队近期战绩,输出一个胜率,就能提前知道比赛结果。如果算法预测真这么简单,足球数据分析市场早就失去价值了。真实情况是…

作者头像 李华