news 2026/9/5 23:30:40

Ultimate Vocal Remover 5.6:免费人声分离,3步出结果

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Ultimate Vocal Remover 5.6:免费人声分离,3步出结果

Ultimate Vocal Remover 5.6:免费人声分离,3步出结果

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

你想做一首歌的卡拉OK伴奏,找不到干净的纯音乐。Ultimate Vocal Remover v5.6 是一款免费开源的人声分离工具:指向一首歌,跑完你会拿到人声、伴奏两个文件。

它到底能帮你解决什么

最常见的需求是搞一段干净伴奏。你想翻唱一首歌,需要把原曲里的人声拿掉。UVR 做的就是人声分离:输入指向原曲,跑完输出目录里会有人声、伴奏两条轨,伴奏可以直接拿去当伴奏带。

另一个是 remix 场景。做音乐时经常需要把一首歌拆成单独的轨再加工。软件里自带 Demucs、MDX-Net、VR Architecture 几个分离模型,Demucs 的 4-stem 模型对编曲复杂的歌更稳,你可以按歌挑。

老录音、播客这类材料,可以只把人声抠出来,再用自带的降噪模型把伴奏里分离后残留的底噪清一遍。分离是神经网络算出来的,没有传统频谱减法那种发闷的感觉,结果可以直接用在正式项目里。

从安装到第一次出人声分离结果

先把仓库克隆到本地目录,再跑仓库里的安装脚本,它照着 requirements.txt 把 PyTorch 等依赖逐个装上,然后用 python UVR.py 启动。

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui && cd ultimatevocalremovergui sh install_packages.sh && python UVR.py

打开后你会看到上面两行是 Select Input 和 Select Output 框,旁边选输出格式,WAV/FLAC/MP3 三选一。中间一行是分离方法、片段大小、重叠率三个下拉框,下面一排是 GPU Conversion、Vocals Only 这类复选框,最底下是一根 Start Processing 按钮。

第一次跑,参数一个都别动:默认方法是 MDX-Net,默认模型是 MDX23C-InstVoc HQ,选一首输入歌、选一个输出目录、点 Start Processing,就三个动作。跑完输出目录里会多出一个人声文件和一个伴奏文件。先跑通,回头再调。

几个真正影响听感的关键变量

片段大小(Segment Size)控制模型一次听多长一段音频。默认是 256。歌长、编曲密的话可以往 512 甚至 1024 调,模型看到的上下文更多,段落之间的过渡会更顺。但调太猛内存压力会明显上来,显存或内存吃紧的机器会直接报错。

重叠率(Overlap)控制相邻两段各有多少重叠。默认是 8。调高到 16,接缝处混合得更充分,不容易听到段落边界的跳变。但计算时间也跟着涨,再往上的音质收益很小。

第三个变量是模型本身。它决定底层算法,默认的 MDX-Net 速度快,Demucs 稍慢但对复杂编曲更稳。分离结果人声里残留乐器太多的话,换 Demucs 的 4-stem 模型对比一下。

想批量处理一整张专辑,或者把多个模型的输出融合成一个结果,软件里都有对应选项,配置在 lib_v5/vr_network/modelparams/ 目录,这里不展开。

新手大概率会踩的坑

你大概率会碰到「MP3 处理不了、直接报错」→ 原因是系统没装 FFmpeg,UVR 靠它转非 WAV 文件 → 装好 FFmpeg 再重启程序就好。

你大概率会碰到「处理到一半报内存分配错误」→ 原因是片段大小超出机器承受能力 → 把 Segment Size 降回 256 或更低,没独显的机器把 GPU Conversion 取消勾选,交给 CPU。

你大概率会碰到「伴奏里还有一点点鬼唱」→ 原因是没有任何模型能分得绝对干净,残留是常态 → 换个模型再跑一遍对比,或者直接用自带降噪模型再过一遍。

接下来可以折腾的方向

第一首歌跑完,可以把调好的参数存成一组设置,下次直接加载。想知道新版加了什么,看 gui_data/change_log.txt。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 23:28:24

如何让1小时录音15分钟转完:faster-whisper 语音转文字上手指南

如何让1小时录音15分钟转完:faster-whisper 语音转文字上手指南 【免费下载链接】faster-whisper Faster Whisper transcription with CTranslate2 项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper 昨晚整理客户电话录音,2 小时…

作者头像 李华
网站建设 2026/9/5 23:28:10

数据中心可以不耗水吗?WUE与冷却技术拆解

看到“微软在威斯康星 Fairwater 的数据中心年耗水量不超过一家本地餐厅”这类说法,第一反应不该是“是不是公关宣传”,而应该是“这个结论是在什么统计口径下成立的”。数据中心不是不耗水,而是把耗水的环节换掉了。耗水这件事,和…

作者头像 李华
网站建设 2026/9/5 23:27:59

PLFM_RADAR:完整的开源 10.5 GHz 相控阵雷达,3 步跑通演示

PLFM_RADAR:完整的开源 10.5 GHz 相控阵雷达,3 步跑通演示 【免费下载链接】PLFM_RADAR Open-source, low-cost 10.5 GHz PLFM phased array RADAR system 项目地址: https://gitcode.com/GitHub_Trending/pl/PLFM_RADAR PLFM_RADAR(代…

作者头像 李华
网站建设 2026/9/5 23:27:21

3步把Windows 10界面搬回Windows 11:ExplorerPatcher上手指南

3步把Windows 10界面搬回Windows 11:ExplorerPatcher上手指南 【免费下载链接】ExplorerPatcher This project aims to enhance the working environment on Windows 项目地址: https://gitcode.com/GitHub_Trending/ex/ExplorerPatcher 把任务栏图标拖到左边…

作者头像 李华
网站建设 2026/9/5 23:26:21

霞鹜文楷字体配置指南:3 步把 LXGW WenKai 装进 VSCode 和终端

霞鹜文楷字体配置指南:3 步把 LXGW WenKai 装进 VSCode 和终端 【免费下载链接】LxgwWenKai An open-source Chinese font derived from Fontworks Klee One. 一款开源中文字体,基于 FONTWORKS 出品字体 Klee One 衍生。 项目地址: https://gitcode.c…

作者头像 李华
网站建设 2026/9/5 23:25:37

CSP认证C++真题精解:从贪心算法到模拟优化实战指南

简介:本资源是面向CCF CSP认证考生的C语言真题解析合集,聚焦算法设计、数据结构实现与编程实战能力提升,适用于备考初学者至中高级水平的学习者。压缩包共29个文件,含28个可直接编译运行的C源码文件(.cpp)与…

作者头像 李华