news 2026/9/4 12:05:24

10 分钟语音数据,练出专属变声模型:RVC 快速上手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10 分钟语音数据,练出专属变声模型:RVC 快速上手指南

10 分钟语音数据,练出专属变声模型:RVC 快速上手指南

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

RVC(Retrieval-based-Voice-Conversion-WebUI)是一套基于 VITS 的 AI 变声模型训练框架,自带网页界面,用约 10 分钟的语音数据就能训出可用的变声模型,低显存设备也能跑。下面按"先跑通、再自建环境、然后训练、最后排查问题"的顺序,带你走完部署到推理的全过程。

一、最短路径:整合包一键启动

如果你只想尽快用上,先走这条路径,跳过所有手动安装。

  1. 下载RVC-beta.7z整合包并解压到任意目录(路径建议不含空格和中文)。
  2. 按系统启动:
# Windows:在解压目录内双击 go-web.bat # macOS:终端进入解压目录后执行 sh ./run.sh

启动完成后浏览器会自动打开 WebUI。Windows 下看到黑色命令行窗口出现 gradio 访问地址即算成功;macOS 下终端持续输出且无报错即可。

两条说明:

  • 整合包已内置全部预训练资产与依赖,无需再做本文第二节;
  • 想换显卡驱动方案、升级 Python 或自定义环境,再看下面各节。

二、自建环境:从源码安装

2.1 获取源码

需要手动搭建环境时,先克隆仓库:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

2.2 安装依赖

依赖安装分 pip 和 poetry 两条路径,按显卡类型各有一份 requirements 文件。

pip 路径(Python 版本需大于 3.8)

先安装 PyTorch 本体(已装可跳过),再按显卡选清单:

# 1. 安装 PyTorch 核心三件套 pip install torch torchvision torchaudio # 2. Windows + RTX 30 系显卡时,按经验固定 cu117 索引 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117 # 3. 按显卡类型安装项目依赖(四选一) pip install -r requirements.txt # N 卡 pip install -r requirements-dml.txt # A 卡 / I 卡(DirectML) pip install -r requirements-amd.txt # A 卡 ROCM,仅 Linux pip install -r requirements-ipex.txt # I 卡 IPEX,仅 Linux

验证成功的方式:执行python -c "import torch; print(torch.__version__)"能打印版本号且无报错。

poetry 路径(建议 Python 3.7–3.10)

3.11 及以上版本在装llvmlite==0.39.0时会冲突,用 poetry 时建议锁定 3.7–3.10:

poetry init -n poetry env use /path/to/python3.10 poetry run pip install -r requirements.txt

macOS 用户可以直接用项目自带的脚本创建虚拟环境并装依赖:

sh ./run.sh

2.3 下载预训练资产

推理和训练都依赖一批预训练文件。tools/目录下提供了下载脚本(如download_models.pydlmodels.sh),也可手动按清单补齐:

文件用途是否必须
assets/hubert/hubert_base.pt语音特征提取必须
assets/pretrainedv1 预训练模型目录必须
assets/uvr5_weightsUVR5 人声/伴奏分离权重必须
assets/pretrained_v2v2 版本预训练模型用 v2 才需要

确认方式:上述路径下能看到对应文件即可。

2.4 安装 ffmpeg 与音高提取模型

项目用 ffmpeg 读写音频,用 RMVPE(InterSpeech 2023 的音高提取算法)提取音高。RMVPE 效果显著优于传统算法,且速度更快、资源占用更小,能解决哑音问题。

# Ubuntu / Debian sudo apt install ffmpeg # macOS brew install ffmpeg

Windows 用户下载ffmpeg.exeffprobe.exe放到项目根目录即可(已装可跳过)。

然后下载 RMVPE 音高模型参数rmvpe.pt放到 RVC 根目录;A 卡 / I 卡用户如走 DML 路径,可另备rmvpe.onnx

AMD ROCM(仅 Linux)用户还需保证用户加入rendervideo组,特定型号显卡(如 RX6700XT)需额外设置ROCM_PATHHSA_OVERRIDE_GFX_VERSION环境变量,按发行版文档配置即可。

三、启动 WebUI

# 常规启动 python infer-web.py # 用 poetry 装的依赖则加上 run poetry run python infer-web.py

I 卡 IPEX(Linux)用户启动前先加载 Intel oneAPI 环境:

source /opt/intel/oneapi/setvars.sh

看到终端打印出 WebUI 访问地址、浏览器打开后出现音色列表和训练面板,即为成功。

四、训练:10 分钟数据怎么用

数据时长。推荐 10–50 分钟训练集;音质高、底噪低的前提下,音色统一有个人特色,数据越多越好。如果做的是精简且音色有特色的数据集,5–10 分钟也能训出可用模型。1 分钟以下的数据基本不可复现,不建议尝试。

训练管线做了三件关键事

  • top1 检索替换:推理时从训练集特征库中检索最相近(top1)的特征替换输入源特征,从机制上杜绝音色泄漏,输出更贴近目标音色;
  • UVR5 分离:可直接调用 UVR5 模型分离人声与伴奏,省去手动找干声的麻烦;
  • RMVPE 音高提取:替代旧算法提取 F0 音高,哑音更少。

操作顺序(全程在 WebUI 内点击完成,无需写代码):

  1. 把 16k–48k 的语音文件放入训练集目录,切分出训练/验证集;
  2. 提取特征与音高(WebUI 对应按钮,底层调用infer/modules/train/下脚本);
  3. 设置批大小与训练轮数。显存紧张时调小 batch size——VITS 结构下该项目在较老的显卡上也能较快收敛;
  4. 一键训练。终端显示Training is done. The program is closed.即训练成功。
  5. 训练完成后执行"添加索引",生成added_开头的索引文件。检索防泄漏依赖的就是这份索引。

五、推理与刷新音色

用训好的模型推理前,先点击音色列表旁的刷新按钮。新模型不显示时优先做这一项,再看训练日志。日志位置:logs/下以实验名命名的目录,出问题时可截图控制台与 WebUI 一并排查。

推理参数重点看音高(整数升降调)与检索特征库开关:检索功能正是 top1 替换机制的入口,保持开启。

六、常见坑排查

现象原因与处理
ffmpeg error / utf8 error多数不是 ffmpeg 本身的问题。路径含空格、()等特殊符号会触发 ffmpeg 报错;中文路径写入filelist.txt时会出现 utf8 报错。把数据集目录挪到无空格、纯英文的路径下即可
训练结束后紧跟一串报错显示Training is done后紧邻的报错是假报错,训练已成功,可忽略
一键训练结束没有added_索引训练集过大时内存 add 索引会卡住,项目已改为批处理 add 缓解;临时处理:重新点击一次"训练索引"按钮
推理时看不到新训音色先点刷新音色列表;仍没有则回查训练是否报错(控制台 + WebUI 截图 +logs/日志)

进阶建议

  • 数据质量优先于数量:精简、低噪、音色统一的小数据集,效果常常好于大而杂的集合;
  • 想试 v2 架构:额外下载assets/pretrained_v2资产包后,在 WebUI 中选用 v2 配置即可;
  • 批处理推理与 ONNX 导出(tools/infer_batch_rvc.pytools/export_onnx.py)适合批量换声与部署场景,按需再看对应脚本说明。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 12:05:01

【会议征稿通知 | 香港城市大学、深圳河套学院、南昌大学主办 | ACM出版 | EI 、Scopus稳定检索】2026年人工智能赋能科学发现与创新国际会议(AI4Science 2026)

2026年人工智能赋能科学发现与创新国际会议(AI4Science 2026) 2026 International Conference on Artificial Intelligence for Science 2026年10月23-25日 | 中国深圳 大会官网&#xff1a;www.ic-ai4science.org 截稿时间&#xff1a;见官网&#xff08;早投稿&#xff0c…

作者头像 李华
网站建设 2026/9/4 12:02:53

不止于看:硬件电路设计实战成长计划,从原理图到调试通关

1. 为什么我做了这个“不止于看”的实战专栏做硬件电路设计这行当久了&#xff0c;我特别怕一种现象&#xff1a;看着都会&#xff0c;一上手就废。前阵子有个刚入行的朋友跟我吐槽&#xff0c;说自己在B站和公众号里收藏了几百G的资料&#xff0c;从模拟电路到单片机应用&…

作者头像 李华
网站建设 2026/9/4 12:02:24

前Meta/XREAL产品负责人入局可穿戴硬件,创业技术链拆解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 12:01:58

基于PyTorch的对偶GAN图像去雾:从原理到工程实践

简介&#xff1a;本资源是一套基于PyTorch实现的对偶生成对抗网络&#xff08;Dual GAN&#xff09;图像去雾完整项目&#xff0c;专为计算机相关专业本科生毕业设计与课程实践打造&#xff0c;已通过导师评审并获99分高分。项目聚焦真实场景下的雾霾图像复原任务&#xff0c;涵…

作者头像 李华
网站建设 2026/9/4 12:01:28

帕梅拉健身跟练指南:新手30天高效燃脂计划

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 12:00:42

xiaozhi-esp32 摄像头集成实战:3 步给嵌入式 AI 装上“眼睛“

xiaozhi-esp32 摄像头集成实战&#xff1a;3 步给嵌入式 AI 装上"眼睛" 【免费下载链接】xiaozhi-esp32 An MCP-based chatbot | 一个基于MCP的聊天机器人 项目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32 本文基于 xiaozhi-esp32 开源项目…

作者头像 李华