模型集成组合:三套 Ensemble 组合与耗时

集成模式(Ensemble Mode)是 UVR5 把多颗模型结果融合输出的高级能力,通过 Max Spec、Average、Min Spec 三种算法取各家之长。组合得当能明显提升分离质量,但也会成倍增加耗时。本文给出三套可复用组合及其算法与耗时参考。

集成算法怎么选

三套可复用组合

组合类型构成算法耗时预估
人声向MDX-Net Main + Kim VocalAverage约单模型两倍
伴奏向Inst Main + Inst 3Min Spec约单模型两倍
质量优先MDX-Net 双变体 + Demucs 跨引擎Max Spec约三到四倍

人声向组合

把 Main 与 Kim 同向叠加,取两者人声还原的互补,背景残留通常比单颗更干净。算法用 Average 能得到平衡的干声,适合翻唱与训练数据准备。注意两颗都必须是人声向,不要把 Inst 混进来,否则输出目标互相打架,结果反而更差。

伴奏向组合

Inst Main 配 Inst 3,用 Min Spec 压低人声,伴奏更干净,是 K 歌伴奏的高配做法。两套都是 MDX-Net 的 onnx 模型,速度尚可,CPU 用户也能接受。若原曲人声极难剥离,可再适度提高 overlap 配合,进一步收紧边界。

质量优先组合

跨引擎集成 MDX-Net 的变体与 Demucs,用 Max Spec 保留最多细节,适合母带级交付,但耗时可达单模型三到四倍,必须放进批量队列挂机。无独显的电脑不建议把它当日常组合,否则一次处理可能要等很久,效率难以接受。

组合不是越多越好

集成模式把每颗模型的结果按算法融合,模型数量直接决定耗时。人声向两颗、伴奏向两颗、质量优先三颗,是效果与效率的甜点区间。继续叠加更多模型,质量提升边际递减,耗时却线性甚至超线性增长,普通用户不值得。每多一颗模型,不只是多一倍时间,还有更多融合误差累积。

保存与复用配置

调好一组组合后,在软件里保存为 Ensemble 配置,下次直接调用,无需重复勾选。建议给每组起明确名字,例如人声平均组、伴奏压制组,避免日后混淆。配置只记录模型与算法,不绑定具体文件,模型缺失时会提示补下,不影响其他配置。

耗时预估的变量

上表的耗时是相对单模型的倍率,实际还受音源长度、segment size、是否开 GPU 影响。有独显时倍率感受被削弱,CPU 用户则要严格控组数。长曲加高质量组合可能要等很久,务必走批量队列,不要前台干等,以免占用机器又影响其他工作。

下一步

组合保存为 Ensemble 配置后可一键复用,配置方法见集成模式详解。组合前请先通过模型对比页面确定每颗模型的取向,避免把目标相反的模型放进同一组。