UVR5 与 RVC 唱声转换的配合流程

AI 翻唱和歌声转换(如 RVC、so-vits-svc 类项目)的工作流里,UVR5 承担的是源头清洗的角色:把歌曲拆成干净干声与纯伴奏,前者作为转换素材或训练数据,后者作为最终合成的背景。本文梳理两端配合的标准流程与音质要求。

整体工作流一览

完整的 AI 翻唱链路是:原曲 → UVR5 人声分离(得到干声与伴奏)→ UVR5 去混响去噪(净化干声)→ RVC 推理(用目标音色重唱干声)→ 干声与伴奏重新混合 → 成品。UVR5 的质量直接决定整条链的上限:源头不清澈,后面每个环节都会放大瑕疵。

第一步:分离出高质量干声与伴奏

推理用途的干声推荐 MDX-Net 的 UVR-MDX-NET Main 模型,输出选 Vocal Only,格式保留 flac 或 wav 无损。伴奏用 Inst 系列模型单独提取。如果原曲是高压缩音源,尽量先找到更高质量的版本——RVC 对输入音质非常敏感,压缩伪影会被模型学到音色里。

第二步:干声净化(训练场景必做)

准备 RVC 训练数据集时,干声必须干净:按去回声与去混响指南把 UVR-DeEcho-DeReverb 串进流程,必要时再过一遍 UVR-DeNoise。训练数据里混入的混响与底噪会让模型学出不干净的音色,这是大多数 AI 翻唱成品发糊的直接原因。仅做推理(现成音色直接转换)时,净化干声同样有助于提升转换稳定性。

第三步:RVC 端的对接要点

RVC 训练需要把干声切成若干秒的短音频做数据集,UVR5 输出的长文件交给 RVC 的切片工具处理即可;推理时把净化后的干声导入 RVC 客户端选择音色模型转换。转换完成的音轨再与 UVR5 提取的伴奏按原曲比例混合,得到最终翻唱。

常见踩坑

UVR5 与 RVC 各自的进阶设置,请分别阅读本站参数详解教程与 RVC 社区文档,两者独立更新,注意版本兼容性。