掩蔽是什么 | UVR5 中文站

掩蔽(Masking)是听觉系统的基本特性:当一个声音足够强时,它会把同时出现、频率相近的另一个更弱的声音盖住,让人听不清甚至完全听不到。放在人声分离里,这正是模型用来「判断哪段频谱属于谁」的重要依据——被掩蔽的部分,模型可以放心地归给更强的那个声源。

UVR5MDX-Net 模型大量依赖掩蔽(Masking)思想工作。理解它,能帮你明白为什么有些歌分离得很干净,有些歌却总在互相串音。下面从原理、依赖方式、对结果的影响三步讲清。

频域掩蔽与时域掩蔽

掩蔽分两种。频域掩蔽(Frequency Masking)发生在同时刻:一个强音会抬高它附近频率的听阈,让弱音被掩盖,这种现象也叫临界频带掩蔽。时域掩蔽(Temporal Masking)发生在时间上:强音出现前后极短一段时间里,弱音也会被盖住,分为前掩蔽和后掩蔽。两种掩蔽都说明,人耳对「绝对安静」不敏感,只对「相对差异」敏感。

模型正是利用这点,把被强声源掩蔽的频谱区域判给强声源。这也是为什么人声和伴奏能量越分明,分离越容易;两者能量越纠缠,越容易串音。

分离模型为什么依赖它

MDX-Net 在频谱上学习一个时频掩蔽(Time-Frequency Mask),也就是给每个时间-频率点一个权重,决定它属于人声还是伴奏。这个掩蔽(Mask)不是凭空算的,而是利用了人耳掩蔽特性:在强伴奏掩盖人声的频率带,模型可以低调处理人声;在清晰频段,则精细保留。换句话说,掩蔽既是人类听感的规律,也是模型输出结构的直接形式,两者在这里合二为一。

对分离结果的影响

掩蔽特性带来两面性:

常见误解

掩蔽是不是越多越好?

不是。掩蔽是客观听感规律,不是可调参数。你能在模型层面利用它,但无法「增加掩蔽」来改善结果;能调的是 Overlap、Segment Size 这类影响上下文长度的参数,间接帮助模型区分被掩蔽的区域。

下一步建议

想看掩蔽怎么落到模型上,可继续读「源分离是什么」了解整体方法,或读「底噪与信噪比」看另一种干扰分离的因素。实际处理重叠严重的片段时,试着把 Overlap 提到 0.5 以上对比听感,往往比换模型更立竿见影。