阿卡贝拉分离:合唱声部的可行做法 | UVR5 中文站
阿卡贝拉分离常被误解成「把合唱里的高中低声部拆开」。要先泼一盆冷水:UVR5 的设计目标是把人声和伴奏分开,不是把混在一起的多个人声拆成独立声部。本文讲清它能做什么、做不到什么,以及清唱干声怎么提。
所以如果你想要的是「把四部和声拆成四条独立音轨」,UVR5 给不了。它能给的是:从带伴奏的阿卡贝拉录音里去掉伴奏,得到人声混合干声;以及从录音里削弱房间回响。
难度来源
阿卡贝拉的人声本身就是多个声部叠出来的,频段大量重叠,AI 没有「这是女高音那是男低音」的标签,只能按频谱猜。而 UVR5 的训练目标是人声对伴奏,遇到「全是人声」的输入,它的分离逻辑失效,输出往往还是混在一起。
另一个难点是节拍和呼吸。阿卡贝拉常用拍手、跺脚、口技当打击乐,这些被模型误判成人声或乐器都有可能,结果轨道里杂着不该有的成分。
能做到什么程度
- 能:从带钢琴或伴奏垫的阿卡贝拉里,用 Main 提出人声混合干声。
- 能:用 DeEcho-DeReverb 把排练厅回响收干,方便听清声部。
- 不能:把混声合唱拆成独立的女高、女中、男高、男低四条。
- 不能:分离两个贴很近、几乎同音域的人声。
如果你要的是清唱干声当素材,上面的「能」已经够用;要的是分声部,请转向专门的多说话人分离或人工扒谱,别在 UVR5 上死磕。
模型与参数建议
取人声干声:MDX-Net 的 UVR-MDX-NET Main,Overlap 0.5,Segment Size 256,显卡开 GPU。想要更干净可叠 Min Spec 集成。收回响:VR 的 UVR-DeEcho-DeReverb,Aggression 中档即可,阿卡贝拉本身轻盈,去太狠会丢泛音。
若是纯人声无伴奏录音想降一点房间感,只跑 DeReverb 就够了,不必跑 Main,因为本来就没有伴奏可分。
实用工作流
| 目标 | 模型 | 说明 |
|---|---|---|
| 去伴奏提人声 | UVR-MDX-NET Main | 得混合干声 |
| 收排练厅回响 | UVR-DeEcho-DeReverb | 听清声部 |
| 分独立声部 | 不支持 | 需其他方案 |
下一步建议
下一步,拿一段你有的阿卡贝拉录音,先跑 Main 看人声干不干净,再单独跑 DeReverb 听声部清晰度。把预期从「分声部」降到「取干声」,反而容易满意。要真分声部,建议每个声部单独录,后期叠轨最稳。
为什么分声部这么难
声源分离本质是「按训练目标猜掩码」。UVR5 只学过人声对伴奏,没学过男低对女高。让它做没学过的事,结果不可靠,这是模型架构决定的,不是调参能解决的。训练目标决定了能力边界,这一点在合唱素材上尤其明显:输入全是同类人声,算法没有可依赖的对比信号,输出只能是混在一起的人声干声。贴得很近、几乎同音域的两路人声在频谱上几乎重叠,模型无法分配掩码。真要分声部,最稳的是录音时每声部单独录一条,后期叠轨,而不是后期硬拆。