news 2026/9/19 3:21:28

10 分钟用 RVC WebUI 的 UVR5 人声提取跑通一次人声伴奏分离:免费开源新手指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
10 分钟用 RVC WebUI 的 UVR5 人声提取跑通一次人声伴奏分离:免费开源新手指南

10 分钟用 RVC WebUI 的 UVR5 人声提取跑通一次人声伴奏分离:免费开源新手指南

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

本文带你用 RVC WebUI 的 UVR5 人声提取模块,把立体声音频拆成人声轨和伴奏轨,产出能直接翻唱、配音的分离文件。

📍 先花 30 秒判断:UVR5 人声伴奏分离是不是你要干的

如果你手里有一首歌、只想留伴奏再录自己的声音出翻唱,或者一段播客混进了房间回声听感很闷,那这篇就是为你写的。RVC WebUI 的 UVR5 人声提取就是干这个的:指向一个音频文件夹,点一次按钮,处理完你拿到两个文件夹,一个纯人声、一个纯伴奏。它不能实时分离,必须等整段文件跑完,所以别拿它处理直播流。整件事不需要你懂信号处理。

⚙️ 开始前备齐这三样:RVC WebUI 人声提取环境

  1. 运行环境与依赖:先 clone 仓库再按显卡装依赖。CPU、AMD、Intel 装python -m pip install -r requirments_cpu_py312.txt;NVIDIA 先装对应 CUDA 版本的 torch,再装requirments_cu118_py312.txtrequirments_cu128_py312.txt
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
  1. 输入音频要求:待分离的立体声文件,格式 wav、flac、mp3 都行。源文件不是 44100Hz 双声道时程序会自动重采样,但低码率、单声道、严重削波的源会明显拉低分离上限,优先给无损。
  2. UVR5 权重(推荐前置):模型下拉框里的选项直接读assets/uvr5_weights/目录,里面必须有.pth权重才能选到模型。用下面命令把权重拉进该目录:
hf download lj1995/VoiceConversionWebUI --revision main --include "uvr5_weights/*" --local-dir assets

🎬 从打开界面向到看到结果:完整操作走一遍

装完依赖用python webui.py启动(Windows 也可直接双击go-webui.bat),浏览器会自动打开主界面。界面顶部一排标签页里,点开「伴奏人声分离&去混响&去回声」,本章所有字段都在这一个标签页内。

先定模型,这是后面一切的前提。选 HP2 还是 HP5,取决于歌里有没有和声:没有和声选 HP2 或 HP3,想完整保留主人声;带和声只想留主旋律就选 HP5。要去的不是人声而是回声,那就选onnx_dereverb_By_FoxJoy或 DeEcho 系列。选错模型,参数怎么调都是白跑。

再填输入待处理音频文件夹路径,填待分离音频所在目录的绝对路径即可;如果你只想处理手里这几个文件,用旁边「也可批量输入音频文件」直接拖进来,两者二选一,填了文件夹就优先读文件夹。输出目录指定输出主人声文件夹指定输出非主人声文件夹默认都是opt,人声和伴奏会分别落在各自子目录里,一般不用改。

导出文件格式默认 flac,无损适合还要二次加工;只存档分享选 mp3 更省空间。全部填完点转换按钮,右侧「输出信息」区逐行打印结果,看到形如文件名 → 成功的字样,这条就算跑完了;全部文件都出现「成功」,本次分离即完成。验收很简单:去主人声文件夹听人声是否完整、伴奏有没有漏进来,再去非主人声文件夹听歌词是否已经听不出来,两边都过关才算合格。

🔧 那个最影响结果的参数:UVR5 模型选择单独掰开讲

模型决定"怎么分",其他字段只是决定"分完存成什么",所以它单独拿出来讲。机制上,每个 UVR5 权重是在不同目标上训练的:HP 系列抠人声,DeEcho 系列去延迟,onnx_dereverb_By_FoxJoy用 MDX-Net 去双通道混响,选哪个直接决定输出是干净人声还是去了回声的整轨。

你的场景建议选
无和声,留完整主人声HP3
无和声,均衡稳健HP2
有和声,只留主旋律HP5
去双通道房间回声onnx_dereverb_By_FoxJoy
去延迟/单声道混响DeEcho-Aggressive

拿不准就先按无和声选 HP3 跑一遍,听出来再换。其余字段照这张表填就行:

字段一句话建议
输入待处理音频文件夹路径待分离目录,优先于文件选择
也可批量输入音频文件只处理几个文件时拖入,二选一
指定输出主人声文件夹默认 opt,人声结果落这里
指定输出非主人声文件夹默认 opt,伴奏结果落这里
导出文件格式默认 flac,存档选 mp3

🔍 结果不对?人声分离排错顺序查四件事

  1. 怀疑模型/参数:先看模型选对没有——有和声的歌用了 HP2 会把和声当主人声留下。对照上面场景表换一个模型重跑。
  2. 怀疑输入源质量:单声道、低码率 MP3、本身削波的文件,分离上限就在那里,模型只能把已有信息分开、不能凭空补信息。换一份无损立体声源再试。
  3. 怀疑依赖/环境:看「输出信息」里有没有报错堆栈,权重不在assets/uvr5_weights/会直接找不到模型,torch 与显卡不匹配常见于装错了依赖文件。
  4. 怀疑版本兼容:NVIDIA 卡要确认 torch 的 CUDA 版本(cu118 或 cu128)和显卡代次对得上,AMD/Intel 走 cpu 依赖并启用 DirectML。

模型下拉框是空的怎么办

  1. 确认assets/uvr5_weights/里有没有以.pth结尾的权重文件,没有就先跑上面的下载命令。
  2. 下载失败就从 README「下载模型」一节手动把权重放进该目录。
  3. 放好后重启python webui.py,「模型」下拉框里就能选到了。

🎯 跑通之后,拿 UVR5 人声提取接着干的 3 件事

  • 如果你要做翻唱:用 HP3 抽出干净伴奏轨,录上自己的声音,再在剪辑软件里把两轨对齐进拍点叠到一起。
  • 如果你要清理播客:先过onnx_dereverb_By_FoxJoy去房间回声,再用 DeEcho-Aggressive 收一遍残留,比单跑一个模型更干净。
  • 如果你要给视频配音:把视频音轨导成音频,分离出伴奏轨垫底,人声轨替换成你的配音,音量按段落拉平。

✅ 你现在的状态和下一步

只要assets/uvr5_weights/里有一组权重、手里有一个立体声音频文件,这件事就只是"填个文件夹、点一下按钮"的事。接下来:

  1. 跑一遍 HP3 听两轨
  2. 残留多时换模型重跑
  3. 人声轨接入 RVC 变声

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/19 3:20:59

AI驱动的游戏出海增长:从买量优化到专属语言引擎实践

过去几年&#xff0c;我踩过最深的坑&#xff0c;就是把“游戏出海”这四个字理解成“把游戏翻译成外语再买量”。直到项目数据连续三个月原地踏步&#xff0c;我才真正意识到&#xff0c;出海的瓶颈从来不是预算不够&#xff0c;而是买量的边际效率在肉眼可见地衰减&#xff0…

作者头像 李华
网站建设 2026/9/19 3:20:55

读书笔记App开发实战:Room表结构、防抖保存与FTS检索

简介&#xff1a;一份基于Android平台的读书笔记App毕业设计论文文档&#xff0c;面向高校计算机专业学生与Android开发初学者&#xff0c;采用Java语言开发设计&#xff0c;解决了传统Web应用只能在PC机上使用、无法随时随地阅读的问题。文档从选题背景、研究现状出发&#xf…

作者头像 李华
网站建设 2026/9/19 3:19:32

Gatsby 与内容分发网络(CDN):原理、收益与实战部署指南

Gatsby 与内容分发网络&#xff08;CDN&#xff09;&#xff1a;原理、收益与实战部署指南 【免费下载链接】gatsby React-based framework with performance, scalability, and security built in. 项目地址: https://gitcode.com/gh_mirrors/ga/gatsby 内容分发网络&a…

作者头像 李华
网站建设 2026/9/19 3:16:34

AI驱动命令行视频剪辑:cutcli自动化工作流实战

视频剪辑这活儿&#xff0c;干过的人都知道&#xff0c;真正耗时间的往往不是创意&#xff0c;而是那些重复到让人麻木的机械操作&#xff1a;切片段、对时间轴、批量导出、统一转码。一个十分钟的成片&#xff0c;背后可能是两三个小时的鼠标点击。这两年AI能力突飞猛进&#…

作者头像 李华
网站建设 2026/9/19 3:16:31

低信噪比磁异常信号相似性度量:OBF分解与EDR结合的方法

简介&#xff1a;一份关于低信噪比下磁异常信号相似性度量的学术论文&#xff0c;面向磁异常探测、信号处理与目标识别领域的研究人员和工程师。磁异常探测在水下目标检测、矿物勘探、交通监控等场景应用广泛&#xff0c;但实测信号幅值随距离快速衰减&#xff0c;易受地磁场噪…

作者头像 李华