人声分离术语表 | UVR5 中文站

人声分离术语表是本站的术语中枢,把散落在各篇教程里的专业名词集中成十一篇短文,按主题分成四组。你不必从头读到尾,遇到不懂的词直接找对应页面即可。本页先讲清楚这些术语分在哪几类、彼此是什么关系,再给你一套顺手的阅读顺序与查找方法。

源分离(Source Separation)是整个软件在做的事,掩蔽(Masking)和相位(Phase)是它背后的声学原理,分轨(Stem)是分离结果的呈现形态。理解这三组概念,能让你明白 UVR5 为什么能拆开人声和伴奏,而不是像老式消音那样简单相减。

术语按主题分组

十一篇术语按主题归为四类,方便你按需查阅:

主题包含术语关注点
基础概念源分离、掩蔽、分轨软件在做什么、原理是什么、结果长什么样
声学现象混响与回声、底噪与信噪比、相位录音里干扰分离的三种常见因素
格式与质量采样率、位深、有损与无损文件本身的质量与导出选择
指标与模型信号失真比、模型格式怎么衡量分离好坏、模型文件怎么装

先读哪几篇

如果你是第一次接触人声分离,建议按下面的顺序入门:

  1. 先读「源分离是什么」,建立整体认知;
  2. 再读「掩蔽是什么」和「相位是什么」,理解为什么人工智能比传统消音强;
  3. 接着读「分轨是什么」,知道分离出来的文件怎么用;
  4. 最后按需查格式类与指标类,解决实际导出和评判问题。

怎么查找某个词

本术语表里的名词大多是第一次出现时给出英文原名,比如掩蔽(Masking)、信号失真比(Signal-to-Distortion Ratio)。如果你只记得英文,可以直接在站内搜索框输入英文词,生成器会自动匹配到对应中文页。每个术语页都只讲自己这一条,不重复别的页面内容,方便你精准定位。

术语之间如何关联

这些概念并不是孤立的。例如高底噪(Noise Floor)会拉低信噪比(SNR),进而压低信号失真比分数;采样率(Sample Rate)和位深(Bit Depth)共同决定原始文件的动态范围;onnx 与 pth 两种格式分别服务于 MDX-Net 和 VR 两套引擎。读的时候把相关页面对照看,理解会更深。建议把本页当成地图,先定位再深入。

如果某篇术语你读完后还想深入,页面底部通常会给出相关实操教程的跳转建议,顺着链接就能从概念走到动手。术语表定位是「解释名词」,不替代步骤型教程,遇到具体按钮和参数仍以引擎教程为准,别指望一篇短文覆盖全部操作细节。

下一步建议

挑一个你现在最困惑的词开始读,读完到对应的实操教程里动手试一次。术语只有落到界面参数上才真正记住,建议边读边打开 UVR5 对照着看模型列表和输出设置,效果远比纯阅读好。

本栏目全部页面