news 2026/9/7 1:23:17

UVR 人声提取入门:第一次导出干净干声,从选模型到调参数

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
UVR 人声提取入门:第一次导出干净干声,从选模型到调参数

UVR 人声提取入门:第一次导出干净干声,从选模型到调参数

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

做混音时想从成品歌里抠出一条干净的人声干声,或者给 KTV 备一份伴奏——这两个活儿都是"人声提取",也就是把混在一起的声轨拆成独立文件。UVR(Ultimate Vocal Remover)是目前开源圈里最成熟的图形化音频分离工具:内置 MDX-Net、VR、Demucs v3/v4 三套分离算法,不用写代码,点界面就能把歌拆成人声和伴奏。

三种装法:Windows 点安装,Linux 两条命令

  • Windows:下载 v5.6.0 一体化安装包,它自带 Python 和 PyTorch,不用配环境。官方明确要求装到 C 盘,装到别的盘会不稳定;用 AMD 或 Intel 独显的话,下载 OpenCL 版本,NVIDIA 卡才用标准 CUDA 版。
  • macOS:提供 arm64 / x86_64 两个 dmg,M1 芯片勾 GPU 加速走 MPS;v5.6.0 还修复了 Sonoma 上点不动鼠标的问题。
  • Linux / 想自己控制环境
pip install -r requirements.txt python UVR.py

系统层面再补两个依赖:图形界面要装python3-tk,MP3、FLAC 等格式的转码依赖 FFmpeg。项目里的 install_packages.sh 可以一键装齐 requirements.txt 的依赖。

第一次人声提取:选文件、选模型、点开始

  1. 点左上角Select Input选音频文件,Select Output指定结果目录;右侧单选框决定导出格式——WAV 无损体积大,MP3 体积小,第一次用建议选 WAV,留足后期余量。
  2. 中间CHOOSE PROCESS METHOD选算法,第一次用选MDX-Net最稳,它默认带的MDX23C-InstVoc HQ就是人声提取的主力模型;有独显就勾上GPU Conversion,速度能翻几倍。
  3. 点底部Start Processing,进度条和右侧控制台实时反馈;跑完在输出目录里找带 Vocals / Instrumental 后缀的文件。

旁边三个勾选框按需勾:Vocals Only 只要人声、Instrumental Only 只要伴奏、Sample Mode (30s) 只处理前 30 秒。换任何模型前,先拿 30 秒试听,比跑完全曲再返工省事得多。

模型按场景选,参数跟着机器走

你的场景这样选
流行歌提人声MDX-Net + MDX23C-InstVoc HQ,默认组合
做 K 歌伴奏MDX-Net 的 Karaoke 模型,去人声更彻底
编曲复杂、想拆更多音轨Demucs v4,一次分出 Vocals / Drums / Bass / Other 四条
现场录音、混响重VR 架构,对这类素材适应性更好

三个参数记住"什么时候设多少"就够了:

  • Segment Size(分段大小):显存或内存紧张就从 1024 降到 512、256;素材简单可以拉大换速度。
  • Overlap(重叠度):默认 8 别动;只有拼接处明显"咔哒"声时才调高。
  • Sample Mode:默认 30 秒,秒数可在 Additional Settings 里改。

出错了怎么排查

  • 内存 / 显存报错:分段从 1024 降到 512,关掉占内存的后台程序。
  • MP3、FLAC 读不进:多半是 FFmpeg 没装,装完重启程序。
  • AMD / Intel 卡点不了 GPU:确认装的是 OpenCL 版安装包,CUDA 版只认 NVIDIA。

再往深走:右侧SELECT SAVED SETTINGS能保存整套参数,批量处理同一批文件时直接复用;想脚本化批处理,核心分离流程在 separate.py 里,模型实现都在 demucs/ 子目录。机器方面 8GB 内存加集显就能跑通,16GB 内存配 RTX 20 系以上体验更顺。

现在就打开 UVR,选一首你熟悉的歌,勾上 Sample Mode 跑 30 秒听听——干声质量达标,再点全曲分离。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 1:22:48

Pipeline ADC工作原理详解:余差传递与数字校正如何实现高速高分辨率

ADC 这东西,搞过几年数据采集或者信号链设计的人都不陌生。但 Pipeline ADC 和其他类型的结构比,确实存在一些理解门槛,很多初学者拿着数据手册看半天,知道它能跑到几百 MSPS、分辨率做到 12 到 16 位,但一碰上“余差传…

作者头像 李华
网站建设 2026/9/7 1:22:39

从业务需求到技术实现:动态工作流引擎的构建与应用

目录 一、业界开源工作流处理引擎系统介绍 二、思考关键实现手段 三、实现动态配置执行工作流 (一)整体架构简易版分析 (二)核心工作流实现 定义动态配置工作流执行上下文信息 定义工作流 定义执行节点 节点执行接口定义 节点执行模版定义 任务执行器定义 执行…

作者头像 李华
网站建设 2026/9/7 1:22:32

MYSQL数据库基本操作:创建、查看、修改、删除

目录 一、创建和查看数据库 (一)创建数据库 1.使用默认字符集 2.使用指定的字符集 (二)查看数据库 二、修改数据库 三、删除数据库 四、注意事项 五、总结 参考资料 干货分享,感谢您的阅读! …

作者头像 李华
网站建设 2026/9/7 1:22:19

四足机器人强化学习实战:从GPU训练到RK3566边缘部署全记录

最近在搞一个 25 厘米级别的四足机器人 Microduck,核心目标是把手头在英伟达 GPU 上训好的强化学习策略,真的搬到一个 RK3566 的开发板上让它自己走起来。整个流程走下来,最大的感受是:"训模型"和"上实机"完全…

作者头像 李华
网站建设 2026/9/7 1:22:16

机器人店长技术拆解:智能饮品机器人联名活动完整链路解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 1:21:43

失败重试队列:上架失败的任务去哪了

失败重试队列:上架失败的任务去哪了 一个消失任务的悬案: 「系统显示完成三百个任务,但平台后台只多出两百六十个商品。四十个任务凭空消失了——没成功、没失败、没有任何记录。查了两天发现:这四十个是『重试中』状态&#xff…

作者头像 李华