10 分钟用 RVC WebUI 的 UVR5 人声提取跑通一次人声伴奏分离:免费开源新手指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
本文带你用 RVC WebUI 的 UVR5 人声提取模块,把立体声音频拆成人声轨和伴奏轨,产出能直接翻唱、配音的分离文件。
📍 先花 30 秒判断:UVR5 人声伴奏分离是不是你要干的
如果你手里有一首歌、只想留伴奏再录自己的声音出翻唱,或者一段播客混进了房间回声听感很闷,那这篇就是为你写的。RVC WebUI 的 UVR5 人声提取就是干这个的:指向一个音频文件夹,点一次按钮,处理完你拿到两个文件夹,一个纯人声、一个纯伴奏。它不能实时分离,必须等整段文件跑完,所以别拿它处理直播流。整件事不需要你懂信号处理。
⚙️ 开始前备齐这三样:RVC WebUI 人声提取环境
- 运行环境与依赖:先 clone 仓库再按显卡装依赖。CPU、AMD、Intel 装
python -m pip install -r requirments_cpu_py312.txt;NVIDIA 先装对应 CUDA 版本的 torch,再装requirments_cu118_py312.txt或requirments_cu128_py312.txt。
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI- 输入音频要求:待分离的立体声文件,格式 wav、flac、mp3 都行。源文件不是 44100Hz 双声道时程序会自动重采样,但低码率、单声道、严重削波的源会明显拉低分离上限,优先给无损。
- UVR5 权重(推荐前置):模型下拉框里的选项直接读
assets/uvr5_weights/目录,里面必须有.pth权重才能选到模型。用下面命令把权重拉进该目录:
hf download lj1995/VoiceConversionWebUI --revision main --include "uvr5_weights/*" --local-dir assets🎬 从打开界面向到看到结果:完整操作走一遍
装完依赖用python webui.py启动(Windows 也可直接双击go-webui.bat),浏览器会自动打开主界面。界面顶部一排标签页里,点开「伴奏人声分离&去混响&去回声」,本章所有字段都在这一个标签页内。
先定模型,这是后面一切的前提。选 HP2 还是 HP5,取决于歌里有没有和声:没有和声选 HP2 或 HP3,想完整保留主人声;带和声只想留主旋律就选 HP5。要去的不是人声而是回声,那就选onnx_dereverb_By_FoxJoy或 DeEcho 系列。选错模型,参数怎么调都是白跑。
再填输入待处理音频文件夹路径,填待分离音频所在目录的绝对路径即可;如果你只想处理手里这几个文件,用旁边「也可批量输入音频文件」直接拖进来,两者二选一,填了文件夹就优先读文件夹。输出目录指定输出主人声文件夹和指定输出非主人声文件夹默认都是opt,人声和伴奏会分别落在各自子目录里,一般不用改。
导出文件格式默认 flac,无损适合还要二次加工;只存档分享选 mp3 更省空间。全部填完点转换按钮,右侧「输出信息」区逐行打印结果,看到形如文件名 → 成功的字样,这条就算跑完了;全部文件都出现「成功」,本次分离即完成。验收很简单:去主人声文件夹听人声是否完整、伴奏有没有漏进来,再去非主人声文件夹听歌词是否已经听不出来,两边都过关才算合格。
🔧 那个最影响结果的参数:UVR5 模型选择单独掰开讲
模型决定"怎么分",其他字段只是决定"分完存成什么",所以它单独拿出来讲。机制上,每个 UVR5 权重是在不同目标上训练的:HP 系列抠人声,DeEcho 系列去延迟,onnx_dereverb_By_FoxJoy用 MDX-Net 去双通道混响,选哪个直接决定输出是干净人声还是去了回声的整轨。
| 你的场景 | 建议选 |
|---|---|
| 无和声,留完整主人声 | HP3 |
| 无和声,均衡稳健 | HP2 |
| 有和声,只留主旋律 | HP5 |
| 去双通道房间回声 | onnx_dereverb_By_FoxJoy |
| 去延迟/单声道混响 | DeEcho-Aggressive |
拿不准就先按无和声选 HP3 跑一遍,听出来再换。其余字段照这张表填就行:
| 字段 | 一句话建议 |
|---|---|
| 输入待处理音频文件夹路径 | 待分离目录,优先于文件选择 |
| 也可批量输入音频文件 | 只处理几个文件时拖入,二选一 |
| 指定输出主人声文件夹 | 默认 opt,人声结果落这里 |
| 指定输出非主人声文件夹 | 默认 opt,伴奏结果落这里 |
| 导出文件格式 | 默认 flac,存档选 mp3 |
🔍 结果不对?人声分离排错顺序查四件事
- 怀疑模型/参数:先看模型选对没有——有和声的歌用了 HP2 会把和声当主人声留下。对照上面场景表换一个模型重跑。
- 怀疑输入源质量:单声道、低码率 MP3、本身削波的文件,分离上限就在那里,模型只能把已有信息分开、不能凭空补信息。换一份无损立体声源再试。
- 怀疑依赖/环境:看「输出信息」里有没有报错堆栈,权重不在
assets/uvr5_weights/会直接找不到模型,torch 与显卡不匹配常见于装错了依赖文件。 - 怀疑版本兼容:NVIDIA 卡要确认 torch 的 CUDA 版本(cu118 或 cu128)和显卡代次对得上,AMD/Intel 走 cpu 依赖并启用 DirectML。
模型下拉框是空的怎么办
- 确认
assets/uvr5_weights/里有没有以.pth结尾的权重文件,没有就先跑上面的下载命令。 - 下载失败就从 README「下载模型」一节手动把权重放进该目录。
- 放好后重启
python webui.py,「模型」下拉框里就能选到了。
🎯 跑通之后,拿 UVR5 人声提取接着干的 3 件事
- 如果你要做翻唱:用 HP3 抽出干净伴奏轨,录上自己的声音,再在剪辑软件里把两轨对齐进拍点叠到一起。
- 如果你要清理播客:先过
onnx_dereverb_By_FoxJoy去房间回声,再用 DeEcho-Aggressive 收一遍残留,比单跑一个模型更干净。 - 如果你要给视频配音:把视频音轨导成音频,分离出伴奏轨垫底,人声轨替换成你的配音,音量按段落拉平。
✅ 你现在的状态和下一步
只要assets/uvr5_weights/里有一组权重、手里有一个立体声音频文件,这件事就只是"填个文件夹、点一下按钮"的事。接下来:
- 跑一遍 HP3 听两轨
- 残留多时换模型重跑
- 人声轨接入 RVC 变声
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考