多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

RVC WebUI UVR5 人声伴奏分离:从克隆代码到出音轨只需 5 步的免费人声提取指南

RVC WebUI UVR5 人声伴奏分离:从克隆代码到出音轨只需 5 步的免费人声提取指南 RVC WebUI UVR5 人声伴奏分离:从克隆代码到出音轨只需 5 步的免费人声提取指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI这篇文章写给第一次碰 RVC WebUIRetrieval-based-Voice-Conversion-WebUI里 UVR5 人声提取功能的新手。做完后,你会拿到两个文件夹:一个装纯人声,一个装伴奏,格式自选 flac/wav/mp3/m4a,可以直接用来做翻唱伴奏或播客去混响。全程大约 20 分钟,其中 15 分钟花在装依赖上。⚖️ 先说清楚:UVR5 人声伴奏分离值不值得上最终效果:一首立体声歌曲进去,出来两轨——vocal_开头的是主人声,另一轨是非主人声(伴奏为主)。分离是算法抠出来的,伴奏里残留一丝人声、人声里漏进一点伴奏属正常水平,不是环境没装好。能做:对一个文件夹批量分离,导出 flac、wav、mp3、m4a 四种格式能做:去混响去回声,onnx_dereverb_By_FoxJoy处理双通道混响,DeEcho系列处理回声不能做:实时分离,必须等整段文件处理完;MDX-Net 去混响只支持双通道心理预期:单声道、低码率源文件会直接拉低分离上限,模型只能分开已有信息,不能凭空补信息 从 0 到第一次出结果:UVR5 人声提取完整流程第 1 步,获取代码:git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI验收:本地出现Retrieval-based-Voice-Conversion-WebUI目录,里面有webui.py和tools/。第 2 步,装依赖。仓库要求 Python 3.12 x64,先建虚拟环境再按显卡选依赖文件:你的硬件安装命令CPU / AMD / Intelpip install -r requirments_cpu_py312.txtNVIDIA RTX 50 系之前先装 CUDA 11.8 版 Torch,再pip install -r requirments_cu118_py312.txtNVIDIA RTX 50 系先装 CUDA 12.8 版 Torch,再pip install -r requirments_cu128_py312.txt注意文件名就是仓库里真实的requirments_*(少一个 e),照抄别改。Linux 还需先装 ffmpeg:Ubuntu 执行sudo apt install ffmpeg。第 3 步,下载 UVR5 分离模型。这一步只下载分离模块的权重,存进assets/uvr5_weights/,不跑 RVC 变声的话其余模型可不装:hf download lj1995/VoiceConversionWebUI --revision main --include uvr5_weights/* --local-dir assets验收:assets/uvr5_weights/下能看到 HP2、HP3、HP5、DeEcho 系列等权重文件。第 4 步,启动界面:python webui.py浏览器自动打开(默认端口 7865)。Windows 用户也可直接双击go-webui.bat。验收:打开「伴奏人声分离去混响去回声」标签页,「模型」下拉框里能列出刚下载的模型。第 5 步,填参数,点「转换」。模型先选对,后面参数才有效:你的目的选哪个模型普通歌曲留主人声,无和声HP2同 HP2,主人声更完整HP3有和声,只留主旋律人声HP5去双通道混响onnx_dereverb_By_FoxJoy去延迟去回声,更彻底的档DeEcho-Aggressive去回声外加去混响(耗时约为前者 2 倍)DeEcho-Reverb其余字段:字段怎么填输入待处理音频文件夹路径待处理音频所在目录;也可改用批量上传文件,填了文件夹则优先读文件夹人声提取激进程度默认 10,范围 0-20,当前版本界面未开放调节,保持默认导出文件格式默认 flac 无损;存档分享选 mp3指定输出主人声 / 非主人声文件夹都填默认opt,结果分别落在两个子目录采样率不用管:源码(tools/uvr5/webui.py)会先用 ffprobe 检查,不是 44100Hz 双声道的文件自动经 ffmpeg 重编码再处理。点「转换」后右侧「输出信息」逐行打出文件名 → 成功即完成。✅ 结果怎么算合格:UVR5 分离效果验收清单打开主人声文件夹(opt/),找vocal_开头的文件:人声是否完整、有没有明显的伴奏漏进来打开非主人声文件夹:歌词是否已经基本听不出来,只剩乐器和鼓两边各抽 2-3 段反复听,重点听副歌高音段——人声最容易被削弱的地方哪边不过关就回第 5 步换模型重跑(和声多的歌从 HP2 换 HP5),或换一份无损源文件再试 出问题了先看这张表:UVR5 人声提取报错排查现象原因处理「模型」下拉框是空的assets/uvr5_weights/里没有权重重新执行第 3 步的下载命令,再重启界面输出信息里出现找不到模型类报错权重路径不完整,.pth/.onnx文件名和模型名对不上检查权重文件名是否完整,别手动改名单声道文件跑 onnx_dereverb_By_FoxJoy 没效果MDX-Net 只支持双通道去混响换双通道录音,或改用 DeEcho 系列分离出的人声发薄、伴奏味重源文件码率太低,信息量不够换 flac/无损源文件重跑启动即崩,报 torch 相关错误显卡和 requirements 文件不匹配(常见于 AMD 用户装了 NVIDIA 版)按第 2 步表格重装对应依赖更多报错含义可查 docs/en/faq_en.md,UVR5 各模块源码在 tools/uvr5/。 接下来还能干嘛如果你想做翻唱:用 HP3 抽出干净伴奏,自己录一轨人声,在剪辑软件里两轨对齐进拍点,一首翻唱就有了。如果你想清理播客回声:先过一遍 onnx_dereverb_By_FoxJoy 去房间混响,再用 DeEcho-Aggressive 收残留,比单跑一个模型更干净。如果你想给视频重新配音:先把视频音轨导出成音频,用 UVR5 把背景音乐和原声分开,留伴奏轨垫底、人声轨换成你的配音。下一步建议:挑一首干净的立体声歌曲把第 5 步完整跑一遍,两个输出文件夹各听一遍;去混响场景按「MDX-Net → DeEcho-Aggressive」的顺序各试一次对比效果;分离稳定后,把vocal_人声文件接到 RVC 主界面,走后续变声流程,相关参数见 训练/推理文档。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表