伴奏提取模型对比:Inst 系列与 Demucs 怎么选

伴奏提取模型对比的核心矛盾是:人声抑制越狠,伴奏里的乐器也越容易受伤。UVR5 里做伴奏的主力有 MDX-Net 的 Inst 系列与 Demucs,两条路线思路不同,适合的场景也不同。本文对比差异并给出 K 歌与翻唱的具体选法。

Inst 系列路线

Demucs 路线

Demucs 走波形域重建,伴奏是 Other 轨加人声剔除后的结果,音色自然、音染偏小,但人声抑制的彻底程度通常不如 Inst Main。它的优势在于整体听感更顺,适合对伴奏保真度要求高、能接受一点人声残留的翻唱场景。这类用户更在意乐器的完整与自然,而非把人声抹得一丝不剩。

K 歌场景怎么选

做 K 歌伴奏追求人声尽量干净,首选 Inst Main,不满意再叠加 Inst 3 上集成模式进一步压低人声。若原曲人声与伴奏耦合很强,可适度提高 overlap 到 0.5 让边界更干净。这类场景不必上 Demucs,因为你要的是伴奏而非音染最小的还原,Inst 的抑制力才是关键。批量转几十首歌时,Inst 的速度优势也更明显。

翻唱场景怎么选

翻唱更看重伴奏的听感真实与乐器完整,推荐 Demucs 的 htdemucs_ft,用其 Other 轨当伴奏底,人声残留少到不影响跟唱时即可。若伴奏里还想单独留某件乐器做参考,Demucs 的四轨能力反而更方便,直接取 Other 与对应分轨混合。对追求还原度的翻唱作者,Demucs 的自然音色更讨喜。

人声残留怎么判断够不够

判断伴奏里人声是否去干净,最可靠的办法是静音试听副歌与气口处。若还能听出原唱旋律,说明残留偏多,可上 Inst 3 集成或提高 overlap。若伴奏里的鼓和贝斯被一起削薄,则说明抑制过度,应回调。平衡点因歌而异,没有统一参数,逐首微调比套用固定值更稳。

体积与速度权衡

Inst 系列是 onnx 模型,体积适中、推理快,适合批量生产 K 歌伴奏;Demucs 体积大、速度慢,但单次听感更自然。如果你的需求是每天几十首歌转伴奏,Inst 路线明显更经济;若是精修少数几首翻唱,Demucs 的保真更值得等待。磁盘与算力紧张时,这个权衡直接决定工作流能否跑顺。

对比结论表

维度Inst 系列Demucs
人声抑制更彻底较温和
伴奏音染略明显偏小自然
典型用途K 歌伴奏翻唱保真
处理速度
翻唱能不能直接拿 Inst 当伴奏

可以,但 Inst 的音染可能让翻唱与原调听感略不同。追求还原选 Demucs 的 Other 轨,追求干净人声痕迹选 Inst,取决于你对保真还是干净更敏感。

下一步

选定伴奏路线后,若人声残留仍困扰你,可参考降噪去混响页面做二级提纯。需要把 Inst Main 与 Inst 3 固化成一组时,见集成组合页面的伴奏向组合示例。