人声分离术语表 | UVR5 中文站
人声分离术语表是本站的术语中枢,把散落在各篇教程里的专业名词集中成十一篇短文,按主题分成四组。你不必从头读到尾,遇到不懂的词直接找对应页面即可。本页先讲清楚这些术语分在哪几类、彼此是什么关系,再给你一套顺手的阅读顺序与查找方法。
源分离(Source Separation)是整个软件在做的事,掩蔽(Masking)和相位(Phase)是它背后的声学原理,分轨(Stem)是分离结果的呈现形态。理解这三组概念,能让你明白 UVR5 为什么能拆开人声和伴奏,而不是像老式消音那样简单相减。
术语按主题分组
十一篇术语按主题归为四类,方便你按需查阅:
| 主题 | 包含术语 | 关注点 |
|---|---|---|
| 基础概念 | 源分离、掩蔽、分轨 | 软件在做什么、原理是什么、结果长什么样 |
| 声学现象 | 混响与回声、底噪与信噪比、相位 | 录音里干扰分离的三种常见因素 |
| 格式与质量 | 采样率、位深、有损与无损 | 文件本身的质量与导出选择 |
| 指标与模型 | 信号失真比、模型格式 | 怎么衡量分离好坏、模型文件怎么装 |
先读哪几篇
如果你是第一次接触人声分离,建议按下面的顺序入门:
- 先读「源分离是什么」,建立整体认知;
- 再读「掩蔽是什么」和「相位是什么」,理解为什么人工智能比传统消音强;
- 接着读「分轨是什么」,知道分离出来的文件怎么用;
- 最后按需查格式类与指标类,解决实际导出和评判问题。
怎么查找某个词
本术语表里的名词大多是第一次出现时给出英文原名,比如掩蔽(Masking)、信号失真比(Signal-to-Distortion Ratio)。如果你只记得英文,可以直接在站内搜索框输入英文词,生成器会自动匹配到对应中文页。每个术语页都只讲自己这一条,不重复别的页面内容,方便你精准定位。
术语之间如何关联
这些概念并不是孤立的。例如高底噪(Noise Floor)会拉低信噪比(SNR),进而压低信号失真比分数;采样率(Sample Rate)和位深(Bit Depth)共同决定原始文件的动态范围;onnx 与 pth 两种格式分别服务于 MDX-Net 和 VR 两套引擎。读的时候把相关页面对照看,理解会更深。建议把本页当成地图,先定位再深入。
如果某篇术语你读完后还想深入,页面底部通常会给出相关实操教程的跳转建议,顺着链接就能从概念走到动手。术语表定位是「解释名词」,不替代步骤型教程,遇到具体按钮和参数仍以引擎教程为准,别指望一篇短文覆盖全部操作细节。
下一步建议
挑一个你现在最困惑的词开始读,读完到对应的实操教程里动手试一次。术语只有落到界面参数上才真正记住,建议边读边打开 UVR5 对照着看模型列表和输出设置,效果远比纯阅读好。
本栏目全部页面
- 人声分离术语表人声分离术语表按主题归集本站的十一篇术语解释,覆盖源分离、掩蔽、分轨、混响、底噪、采样率、位深、有损无损、相位、信号失真比与模型格式,并说明阅读顺序与查找方法,帮你快速建立音频分离的知识框架。
- 源分离是什么源分离是指把混合音频拆回各自独立声源的技术。本文讲清它的定义、从盲源分离到深度学习的历史脉络,以及它和传统相位消音在原理与听感上的根本区别,帮你理解为什么人工智能分离比老方法更能保留人声细节。
- 掩蔽是什么掩蔽是指一个声音被另一个更强声音盖住而听不清的现象。本文解释频域掩蔽与时域掩蔽的原理、说明分离模型为什么依赖它来区分声源,以及这种特性对分离结果干净程度和残留细节的实际影响,帮你建立正确的处理预期。
- Stem 是什么分轨(Stem)指把一首歌拆成多条可独立使用的音轨文件。本文说明四轨与六轨的含义、在数字音频工作站里的工作流,以及它和中文常说的伴奏在概念范围与用途上的区别,帮你正确组织分离后的文件,避免把分轨与伴奏混为一谈。
- 混响与回声混响与回声都是声音反射造成的空间感。本文讲清二者物理成因与听感差异,并说明软件中对应的去混响去回声处理模型,以及这类处理对人声纯净度和自然感的实际影响,帮你选对降低空间感的方法,减少录音里的房间回响。
- 底噪与信噪比底噪是录音里恒定存在的本底噪声,信噪比衡量有用信号相对它的强度。本文说明底噪来源与听感,以及它如何干扰源分离、软件降噪模型的去噪边界在哪里,帮你判断什么时候该降噪、什么时候该重录。
- 采样率对分离的影响采样率决定每秒记录声音的次数。本文对比四十一点一与四十八千赫兹的区别、说明过高或过低采样率对分离效果与速度的实际影响,并给出导入与导出的设置建议,帮你避免无谓地转换采样率,让处理更高效。
- 位深:16bit 与 24bit位深决定每个采样点用多少二进制位记录动态范围。本文对比十六位与二十四位的动态范围差异、说明量化噪声来源,并给出导入与导出时选十六位还是二十四位的实用建议,帮你平衡音质与体积,减少不必要的量化底噪。
- 有损与无损格式有损与无损描述音频压缩是否丢弃信息。本文说明编码伪影为何干扰源分离、对比常见格式特点,并给出导入素材与导出结果时的格式选择原则,帮你避免把高质量成果存成有损文件,减少二次损伤,让分离结果保持干净。
- 相位是什么相位描述声波振动的先后位置。本文解释其定义、说明两声相位抵消产生静音的听感原理,以及传统消音靠相位相减的局限,帮你理解为什么人工智能源分离比老方法更保真,避免被老式消音坑,建立正确预期。
- SDR 是什么信号失真比(SDR)是衡量源分离质量的指标。本文讲清它的定义、说明在分离结果上怎么用、以及为什么不能单看它评判分离好坏,帮你建立合理的质量预期,结合听感和它做判断,避免被一个数字误导,选对模型提升处理效率。
- onnx 与 pth 模型格式onnx 与 pth 是软件使用的两种模型文件格式。本文说明它们的定义、各自归属的推理引擎、文件体积与加载方式的差异,帮你搞清楚下载模型时该放哪个目录、为什么有的模型启动更快,减少放错目录的麻烦,提升使用效率,顺利跑起分离。