Ultimate Vocal Remover 教程:用 UVR 把一首歌的人声和伴奏分开(免费开源,10 分钟出结果)
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(简称 UVR)是一款开源免费的人声提取工具:给它一首歌,它还给你「伴奏」和「人声」两个文件。假设你要做一段卡拉OK练习音源,或者想给视频找一段没有歌词的背景音乐,跟着下面的流程走,从下载到拿到分离结果大约需要 10 分钟。
能力速览:它能做什么、要什么条件
UVR 5.6 是基于 PyTorch 的桌面程序,内置 VR、MDX-Net、Demucs 三套分离引擎。Windows 和 macOS 用预编译包即可,包里已含 Python、PyTorch 和全部依赖,不用自己配环境;Linux 需要手动装依赖。界面会自动记住你上次关闭时的设置,下次直接复用参数。
| 项目 | 说明 |
|---|---|
| 输入 | FFmpeg 能解码的音频:MP3、FLAC、WAV 等;非 WAV 文件依赖系统装有 FFmpeg |
| 输出 | 分离文件(Instrumental、Vocals 等),建议以 WAV 保存 |
| 系统 | Windows 10 及以上(须装在 C 盘)、macOS Big Sur 及以上、64 位 Linux |
| 硬件 | CPU 可跑但很慢;建议 NVIDIA 显卡(最低 RTX 1060 6GB,推荐 8GB 显存);AMD Radeon / Intel Arc 可用 OpenCL 版本 |
首次分离走通流程
第一步:安装并启动
- Windows:运行安装程序,安装位置保持 C 盘不变。
- macOS:按芯片选 arm64(M1 及以上)或 x86_64(Intel)版本。
- Linux:克隆仓库后按 依赖清单 安装并运行:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip3 install -r requirements.txt装好后执行python3 UVR.py(Debian/Arch 系统可先看 install_packages.sh 补齐 FFmpeg、Tk 等系统依赖)。首次启动需要加载模型列表,稍等片刻。
第二步:选择输入文件与输出目录
点击 "Select Input" 把要处理的歌曲加入列表(可一次加多首做批量处理),再指定 Output Folder。输出格式选 WAV 音质最好;处理前把源音频保持 44100Hz 或 48000Hz 采样率,避免二次重采样。
第三步:第一次选什么模型
模型下拉框里先挑 VR 引擎下输出为 Instrumental(伴奏)的人声移除模型。首次使用不用动任何参数,默认值就能跑通全流程。
第四步:参数微调(可选)
- Segment(分段大小,即一次处理多长的一段音频):低配机器设 256,中等配置设 512,高性能机器可用 1024 及以上。
- Overlap(相邻两段的重叠量,用来抹平接缝痕迹):默认 8;人声密集的歌曲提到 12–16 接缝更自然,代价是处理时间变长。
- 有 NVIDIA 显卡就勾选 GPU Conversion,速度通常快 3–5 倍。
第五步:开始处理并取结果
点击 "Start Processing" 等待完成,输出文件夹里就会出现 Instrumental 与 Vocals 文件。第一次结果不满意时,可以换引擎二刷:先用一个模型提人声,再用另一个模型从原曲取伴奏,对比两份结果取更干净的。
模型怎么选:VR / MDX-Net / Demucs
| 你的情况 | 推荐引擎 | 原因 |
|---|---|---|
| 只想去掉人声,流行/摇滚 | VR | 专攻人声移除,其余乐声保留最完整 |
| 编曲复杂、电子音乐,追求人声与乐器平衡 | MDX-Net | 多频带处理,各声部均衡 |
| 要把鼓、贝斯、人声、其他拆成 4 轨 | Demucs | 4-stem 分离(如 v4 的 htdemucs) |
三套引擎的配置分散在 VR 模型参数、MDX-Net 模型数据 与 Demucs 模型数据 目录里,json 中的参数名与每个 .pth 权重一一对应,可据此确认模型身份。分离逻辑本身在 separate.py 中实现。
问题速查表
| 问题 | 原因 | 处理办法 |
|---|---|---|
| 输出里人声残留明显 | 源音质差或模型不匹配 | 换 MDX-Net 再试,overlap 提到 12–16;压缩感强的 MP3 先转成 WAV |
| 内存分配报错 | Segment/Window 开太大 | 把分段大小降到 256 |
| 处理特别慢 | 没走 GPU | 勾选 GPU Conversion 并关闭后台程序;Mac M1 上确认引擎已用 MPS 加速 |
| 打开非 WAV 文件直接报错 | 缺少 FFmpeg | 安装 FFmpeg 后重试,程序会自动调用它解码 |
| Windows 装到副盘后崩溃 | 官方限制 | 重新安装并保持 C 盘路径 |
开始前的行动清单
- 装好对应系统的版本:预编译包最省事,Linux 走上面两条命令。
- 选一首 44.1kHz 的 WAV 放进 Select Input,指定输出目录。
- 选 VR 引擎 + Instrumental 输出,参数保持默认,有 NVIDIA 卡就开 GPU Conversion,点 "Start Processing"。
- 试听 Vocals 与 Instrumental 两份输出,不满意再按速查表调 segment、overlap 或换引擎,做第二次处理。
流程跑通后,一次导入多首歌做批量分离只是多等一首歌的时间。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考