源分离是什么 | UVR5 中文站
源分离(Source Separation)是指把一段已经混在一起的音频,重新拆回若干条彼此独立的声音信号的过程。放到 UVR5 的场景里,就是给软件一段带人声的歌曲,它输出一条干净人声和一条伴奏。它要解决的不是「去掉某个频率」,而是「判断哪些波形属于人声、哪些属于伴奏」。
理解源分离的关键,是把它和「消音」区分开。很多人最早接触的人声提取,是用左右声道相减把居中人声消掉,那本质是相位(Phase)操作,和真正的源分离不是一回事。下面从历史和方法两条线看它怎么发展到今天。
源分离在做什么
一段立体声歌曲在文件里只是左右两个波形。源分离模型要做的是一个逆问题:已知混合结果,反推原始声源。它需要同时估计多条声源的频谱,并保证它们加回去能逼近原曲。这个估计靠的是大量歌曲训练出来的统计规律,而不是固定的数学公式。正因为依赖学习,模型对没见过的混音风格也可能表现不稳,这是它的固有特性。
历史脉络:从盲源分离到深度学习
源分离的研究路径大致经历了几个阶段:
- 早期盲源分离(Blind Source Separation)用独立成分分析(ICA)这类统计方法,假设各声源相互独立,对真实音乐效果有限;
- 随后出现非负矩阵分解(NMF),把频谱拆成基与激活的组合,能处理稳态音色但难抓人声瞬态;
- 深度学习时代,以 Wave-U-Net、Conv-TasNet 为代表的波形域模型,以及 MDX-Net、Demucs 这类在频谱或波形上做掩蔽的模型,把分离质量拉到可用甚至好用的水平;
- UVR5 集成的 MDX-Net、VR 架构与 Demucs,正是这条脉络上的成熟成果,免费且开箱即用。
为什么它不等于相位消音
传统消音利用人声常居中、伴奏左右对称的特点,用左减右把中间成分抵消。它的缺陷很明显:人声一旦偏左偏右就漏掉,伴奏里居中的鼓和贝斯会被误杀,而且必然引入相位(Phase)损伤。源分离不依赖声像位置,而是直接建模声音本身,所以能保留更多细节,也不会把居中的乐器当人声消掉。两者在原理层面就是两条不同的路。
在 UVR5 里它对应什么
UVR5 的三大引擎都在做源分离,只是切分粒度不同:MDX-Net 和 VR 架构主要拆人声与伴奏;Demucs 能进一步拆出鼓、贝斯、其他乐器与人声四轨,或六轨含吉他钢琴。你选哪个模型,本质是在选「要把混合信号拆成几条源」。粒度越细,对硬件和参数的要求也通常越高,不是越多越好。
常见误解
源分离能完美还原原始录音吗?
不能。模型是估计而非精确反演,分离结果必然带有人声残响或伴奏渗人声的失真。质量取决于模型、原曲混音和参数,但不存在零损失的完美分离,这点要提前建立预期。
下一步建议
读完这篇,可以接着看「掩蔽是什么」理解模型内部如何挑声音,再看「分轨是什么」了解分离出来的文件怎么用。遇到具体模型选择,回到对应的引擎介绍页对照,别只凭名字猜测效果。