模型集成组合:三套 Ensemble 组合与耗时
集成模式(Ensemble Mode)是 UVR5 把多颗模型结果融合输出的高级能力,通过 Max Spec、Average、Min Spec 三种算法取各家之长。组合得当能明显提升分离质量,但也会成倍增加耗时。本文给出三套可复用组合及其算法与耗时参考。
集成算法怎么选
- Max Spec:取频谱最大值,偏向保留更多信号,适合质量优先、愿意接受略多残留的场景。
- Average:取平均,结果最平滑,是人声向组合的常见默认。
- Min Spec:取最小值,偏向更彻底地抑制,适合伴奏向压人声。
三套可复用组合
| 组合类型 | 构成 | 算法 | 耗时预估 |
|---|---|---|---|
| 人声向 | MDX-Net Main + Kim Vocal | Average | 约单模型两倍 |
| 伴奏向 | Inst Main + Inst 3 | Min Spec | 约单模型两倍 |
| 质量优先 | MDX-Net 双变体 + Demucs 跨引擎 | Max Spec | 约三到四倍 |
人声向组合
把 Main 与 Kim 同向叠加,取两者人声还原的互补,背景残留通常比单颗更干净。算法用 Average 能得到平衡的干声,适合翻唱与训练数据准备。注意两颗都必须是人声向,不要把 Inst 混进来,否则输出目标互相打架,结果反而更差。
伴奏向组合
Inst Main 配 Inst 3,用 Min Spec 压低人声,伴奏更干净,是 K 歌伴奏的高配做法。两套都是 MDX-Net 的 onnx 模型,速度尚可,CPU 用户也能接受。若原曲人声极难剥离,可再适度提高 overlap 配合,进一步收紧边界。
质量优先组合
跨引擎集成 MDX-Net 的变体与 Demucs,用 Max Spec 保留最多细节,适合母带级交付,但耗时可达单模型三到四倍,必须放进批量队列挂机。无独显的电脑不建议把它当日常组合,否则一次处理可能要等很久,效率难以接受。
组合不是越多越好
集成模式把每颗模型的结果按算法融合,模型数量直接决定耗时。人声向两颗、伴奏向两颗、质量优先三颗,是效果与效率的甜点区间。继续叠加更多模型,质量提升边际递减,耗时却线性甚至超线性增长,普通用户不值得。每多一颗模型,不只是多一倍时间,还有更多融合误差累积。
保存与复用配置
调好一组组合后,在软件里保存为 Ensemble 配置,下次直接调用,无需重复勾选。建议给每组起明确名字,例如人声平均组、伴奏压制组,避免日后混淆。配置只记录模型与算法,不绑定具体文件,模型缺失时会提示补下,不影响其他配置。
耗时预估的变量
上表的耗时是相对单模型的倍率,实际还受音源长度、segment size、是否开 GPU 影响。有独显时倍率感受被削弱,CPU 用户则要严格控组数。长曲加高质量组合可能要等很久,务必走批量队列,不要前台干等,以免占用机器又影响其他工作。
下一步
组合保存为 Ensemble 配置后可一键复用,配置方法见集成模式详解。组合前请先通过模型对比页面确定每颗模型的取向,避免把目标相反的模型放进同一组。