多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

RVC 变声器实战教程:三步完成 AI 音色克隆,低配机器也能训练的语音转换框架

RVC 变声器实战教程:三步完成 AI 音色克隆,低配机器也能训练的语音转换框架 RVC 变声器实战教程三步完成 AI 音色克隆低配机器也能训练的语音转换框架【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个免费开源的语音转换框架收集 10 分钟目标人声训练一个音色克隆模型就能把任意输入音频转成该音色还支持实时变声。本文按实际操作顺序带你从零环境配置走到产出第一个音色模型。一、先看规格RVC 变声器的数据与硬件要求先确认门槛再决定要不要动手。下表全部来自项目说明与官方 FAQ指标数值训练数据量推荐 1050 分钟低底噪人声音质高、音色有特色时 510 分钟也可行硬件门槛4GB 以上显存的 NVIDIA 显卡可训练CPU、AMD/Intel 显卡走 CPU 或 DirectML 方案可跑通推理实时延迟端到端约 170ms使用 ASIO 输入输出设备可低至约 90ms运行环境Python 3.12 x64系统需安装 FFmpeg界面网页 WebUI默认端口 7865界面与文档支持中、英、日、韩、法、葡等语言协议MIT 开源底模由约 50 小时开源 VCTK 语料训练无版权顾虑结论只要有一张 4GB 显存的卡训练和推理都够用完全没卡也能用 CPU 跑推理只是速度慢。二、RVC 环境安装步骤三条命令跑起来环境检查确认已安装 Python 3.12 x64 和 FFmpegLinux 可用ffmpeg -version验证Windows 也可把 ffmpeg.exe、ffprobe.exe 放到项目根目录。三条命令Windows 用户装好 Python 后也可直接双击go-webui.batgit clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m pip install -r requirments_cpu_py312.txt第二条安装命令按硬件二选一NVIDIA 显卡先装对应 CUDA 版本的 PyTorch再装requirments_cu118_py312.txtRTX 50 系以前或requirments_cu128_py312.txtRTX 50 系无 N 卡则用上面的 CPU 版。启动python webui.py浏览器会自动打开 7865 端口。首次启动失败九成是这三个原因预训练模型hubert_base、rmvpe 等文件没按 README 放好、依赖文件与显卡/CUDA 版本不匹配、控制台窗口被关掉导致 Connection Error。三、第一次转换的最小路径音频、训练、索引、推理四步走全程在 WebUI 里点鼠标不需要写代码。准备音频收集 10 分钟以上、底噪小的目标人声切成小段放到一个纯英文、无空格的路径下。 预期看到训练选项卡里能正常浏览并选中这批音频。训练填入实验名选模型版本与采样率v2 配 40k/48k设总轮数后点训练。 预期看到进度条走完并提示训练完成assets/weights/下出现 60MB 以上的 .pth 文件。生成索引点训练索引。 预期看到assets/indices/下生成 added 开头的 .index 文件这是防止音色泄露的关键一步。推理切到模型推理标签刷新音色列表选中刚训练的音色上传一段你自己的录音点转换。 预期看到输出框里出现转换后的音频音色已变成训练集里的人。四、RVC 参数速查表按使用场景选组合使用场景推荐组合实时语音直播/游戏音高提取选 RMVPE用realtime_gui.py启动实时界面输入输出设备选同类型离线高质量RMVPE 48k/40k 采样率模型检索特征占比 0.75 起步保护参数保持 0.33低配机器4GB 显存/无 N 卡CPU 或 DirectML 推理训练调小 batch sizefp32 精度数据差、底噪大总轮数 2030 即可轮数过高带不动低音质数据好、时长多总轮数可提到 200 左右模型本身更稳索引占比影响变小五、常见故障排查从现象到处理办法现象报 ffmpeg error 或 utf8 error。原因音频路径含空格、括号或中文。处理把训练集移到纯英文无空格路径后重跑。现象Cuda out of memory。原因显存不足。处理训练时调小 batch size推理时调低 configs/config.py 里 x_pad、x_query、x_center。现象Connection Error。原因关了控制台黑窗口服务已停。处理保持终端在前台运行。现象Expecting value: line 1 column 1 (char 0)。原因局域网或全局代理干扰。处理关闭客户端与服务端代理后重启。现象训练完在推理列表里看不到音色。原因列表未刷新或误用了 logs/ 下的实验存档模型。处理点刷新音色列表要分享或推理请用assets/weights/下 60MB 的 .pth中间存档需先在 ckpt 处理标签提取小模型。六、进阶音色模型融合与实时延迟降低模型融合ckpt 处理标签页提供 ckpt-merge 功能把两个 .pth 模型按权重混合可以合成新音色、修补某个音域的表现。适合手里有多个相近音色、想取长补短的情况。实时延迟优化用go-realtime_gui.bat或realtime_gui.py启动实时界面输入输出设备选同类型如都用 WASAPI 或都用 MME追求极限延迟就上 ASIO 驱动。参数支持热更新调参不用重启。七、源码定位推理、训练与 WebUI 在哪推理核心语音转换流水线infer/vc/模型结构与特征模块infer/module/RMVPE 音高提取infer/rmvpe.py训练脚本与数据集处理train/其中索引训练见 train/train_index.pyWebUI 主程序webui.py实时变声界面realtime_gui.py设备与显存自适应配置configs/config.py人声伴奏分离UVR5tools/uvr5/多到这一步模型、参数和源码位置都已就位。官方使用文档在 docs/中文 FAQ 在 docs/cn/faq.md版本变化看 更新日志。先跑通一次最小路径再回头调参数效果会好很多。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表