UVR5 Demucs 模型详解:htdemucs 四轨分离

Demucs 是 Meta(Facebook)开源的音频源分离模型,采用时域波形架构,由 Facebook AI Research 持续迭代到第四代。UVR5 把 Demucs 整合进图形界面,使其成为三大引擎中对乐器分轨支持最好的一个。

引擎特点

与基于频域掩蔽MDX-Net 不同,Demucs 直接在波形上重建各个音轨,音色还原自然,音染偏小。它最大的优势是四轨输出:人声、鼓、贝斯、其他乐器一次拆开,这是做扒带、编曲参考与采样提取的关键能力。

常用模型清单

四轨分离怎么用

在引擎区切换到 Demucs 并选择四轨模型后,输出设置里除了人声与伴奏,还可以勾选 Drums(鼓)、Bass(贝斯)、Other(其他乐器)等分轨。处理完成后每个分轨各自输出一个文件,文件名自动标注声部。配合批量处理,可以整批构建分轨素材库。

Shifts 参数

Demucs 的 Shifts 参数控制移位平均:设为 2 或更高时,模型会对音频做多次偏移处理再平均,能压低偶发的分离抖动,但耗时线性增加。日常用 1,交付级任务用 2 即可,不建议更高的值。

乐器分轨的实际用途

四轨分离不只是炫技:鼓轨可以给翻唱当节拍参考或做鼓组采样;贝斯轨方便扒贝斯线的音乐人单独跟练;其他乐器轨常被视频创作者拿来当无版权顾虑的垫乐素材。对编曲学习者来说,把一首成品歌拆回分轨,是理解混音思路最直观的方式——你能清楚听到每个声部在最终成品里被放到了什么位置、做了什么处理。

与 MDX-Net 的场景差异

只需要人声和伴奏,用 MDX-Net 更快也更省资源;需要乐器分轨、或对伴奏音染敏感,用 Demucs。两者也可以在集成模式里跨引擎组合:MDX-Net 提供干净的人声抑制,Demucs 提供自然的音色还原,是质量优先场景的常见搭配。

下载与安装位置

在软件内 Demucs 分类下载。模型体积明显大于另外两个引擎(htdemucs_ft 约 1GB 量级),磁盘空间紧张的用户按需下载。手动安装放进 models 目录下 Demucs 子目录即可。