Ultimate Vocal Remover 完整上手指南:10 分钟免费分离人声与伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
Ultimate Vocal Remover(简称 UVR)是一款免费开源的图形化 AI 人声分离工具,当前版本为 v5.6。它能用深度学习模型把一首歌拆成人声、伴奏等多个音轨。适合想制作卡拉OK伴奏、提取干净人声采样、或给播客分离背景音的你——不需要编程基础,也不需要音乐制作经验。
快速开始:三步装好并跑通第一次分离
UVR 支持 Windows、macOS 和 Linux,官方为 Windows 和 macOS 提供了一键安装包。这里以最常见的「从源码运行」方式为例,三个平台通用。
一键安装步骤
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui python -m pip install -r requirements.txt python UVR.py几点说明:
- 依赖清单见 requirements.txt,核心是 PyTorch(跑 AI 模型的深度学习框架)。
- 如果你有 NVIDIA 显卡,可额外安装带 CUDA 的 torch 以获得 GPU 加速;官方给出的参考命令写在 README.md 的「Manual Windows Installation」一节里。
- 非 WAV 格式的音频(如 MP3、FLAC)依赖系统里的 FFmpeg 做转码,Linux 可先执行
sudo apt install ffmpeg。 - 完整安装细节、macOS 权限放行方法(
sudo xattr -rd com.apple.quarantine ...)都记录在 README.md,遇到卡壳直接查它。
第一次运行:从选歌到出结果
- 启动后界面顶部有Select Input(选输入音频)和Select Output(选输出目录),也支持直接把文件拖进窗口。
- 首次运行需要模型。点设置里的Download Center,按架构(VR Arch / MDX-Net / Demucs)下载你要的模型;模型会分别存入 models/ 目录下的
VR_Models、MDX_Net_Models、Demucs_Models三个文件夹。 - 主界面选择Process Method(处理方法),点Start Processing,进度条走完即可在输出目录看到分离结果(文件名带
_(Vocals)、_(Instrumental)等后缀)。
第一次处理速度取决于硬件:纯 CPU 下一首三四分钟的歌可能需要几分钟,用 GPU 会明显更快。
核心功能怎么用
1. 人声 / 伴奏分离:选方法、选模型、点开始
做什么:把一首歌拆成人声轨和伴奏轨。
怎么操作:在Process Method下拉框选一种 AI 网络,在下拉列表选具体模型。UVR 内置三大网络:
| 处理方法 | 原理 | 适合场景 |
|---|---|---|
| VR Architecture | 基于幅度谱的分离 | 人声/伴奏二分离,模型多,速度较快 |
| MDX-Net | 混合谱图网络 | 人声/伴奏二分离,支持 4 轨(人声/鼓/贝斯/其他) |
| Demucs v3 / v4 | Facebook 的混合谱图网络 | 4 轨甚至 6 轨(含钢琴/吉他)复杂编曲分离 |
预期看到什么:输出目录里出现(Vocals)和(Instrumental)两个 WAV 文件;选 4 轨模型时还会多出鼓、贝斯等音轨。
2. Sample Mode:先试跑 30 秒再决定
做什么:只处理歌曲中的一小段,快速判断某个模型效果如何。
怎么操作:勾选主界面的Sample Mode复选框,括号里的数字是试听时长(秒数),可在Additional Settings菜单里改。
预期看到什么:输出目录里只有一段几秒到几十秒的试分离音频,几十秒内就能得到——换模型对比时能省大量时间。
3. GPU Conversion 与 Batch Mode:加速开关
做什么:用显卡加速、降低显存占用。
怎么操作:
- 勾选GPU Conversion启用 GPU。官方要求:NVIDIA RTX 1060 6GB 起步,8GB 显存以上推荐(见 README.md)。macOS 的 M 系列芯片走 MPS 加速,目前主要兼容 VR Arch 和 MDX-Net 模型。
- MDX-Net 和 VR Arch 支持Batch Mode(批量处理模式),更省内存,多个文件依次处理时建议开启。
实战场景:10 分钟做出卡拉OK伴奏
假设你要把一首喜欢的歌做成无原唱伴奏:
- 选输入:Select Input 选一首 WAV 或 FLAC 文件(无损输入效果最好)。
- 试跑:勾选 Sample Mode(设 30 秒),选 VR Arch 的
5_HP-Karaoke-UVR或 MDX-Net 的 Karaoke 模型,点 Start Processing。 - 对比:试听 30 秒样音,人声残留明显就换模型(比如换 MDX-Net Inst HQ 系列),重复上一步。
- 正式跑:取消 Sample Mode,点 Start Processing 处理整曲。
- 收尾:在输出目录拿
_(Instrumental)文件即可。如果伴奏里还有轻微人声残响,可在 MDX-Net 选项里开启 Denoise 相关选项再跑一遍。
全程不需要导出、剪辑,输入一首歌、输出伴奏文件。
常见问题与调优
按「现象 → 原因 → 解决」排查:
| 现象 | 原因 | 解决 |
|---|---|---|
| 选 MP3/FLAC 时报错 | 系统没装 FFmpeg | 安装 FFmpeg 后重试 |
| 内存不足 / 分配错误 | 分段参数太大 | 调小Segment或Window大小(官方 Troubleshooting 给出的方法) |
| 处理太慢 | 在纯 CPU 上跑 | 勾选 GPU Conversion;或先开 Sample Mode 缩小试跑范围 |
| 分离后有嗡嗡的底噪 | 模型固有噪声 | MDX-Net 下开启Denoise Output,或换用带降噪能力的模型(如UVR-DeNoise-Lite,已随包内置在 models/VR_Models/) |
| 效果不满意 | 模型与歌曲风格不匹配 | 换另一网络/模型重跑,或用后文的 Ensemble Mode 融合多个模型 |
参数调优速查:
- Segment Size:分段大小,越小越省显存但接缝越多,内存紧张时优先调它。
- Overlap:分段重叠度,默认值即可,想要更干净的衔接可适度调大。
- 输出格式:主界面可选 WAV(无损)、FLAC(无损压缩)、MP3(体积小),发烧选 WAV,日常分享选 MP3。
进阶玩法
- Ensemble Mode(集成模式):一次选 2 个以上模型,用均值等算法融合各自输出,能显著改善单个模型的瑕疵,还支持 Demucs 四轨同时集成、把集成配置保存复用。
- Secondary Model Mode:在任一网络里再挂一个「副模型」并调节它的影响比例,比如主模型出人声、副模型补伴奏细节。
- Pitch / Time Stretch:处理时顺带变调或变速,依赖系统里的 Rubber Band 库(安装方式见 README.md)。
- 想深挖模型结构,可以看 separate.py(分离主流程)和 lib_v5/(MDX-Net 网络与参数配置)。
下一步
UVR 的价值一句话:用几行命令装好、几个按钮跑完,把「人声分离」这件专业事变成免费、可重复的日常操作。现在就挑一首歌,按「快速开始」把第一首卡拉OK伴奏跑出来——跑通第一次,后面的一切都是换模型和调参数而已。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考