游戏音效提取:从录屏分离人声与音效 | UVR5 中文站

游戏音效提取的需求很具体:要么想单独拿角色语音做字幕剪辑,要么想保留技能音效去掉对话,要么想把 BGM 和音效分层。本文讲用 UVR5 从游戏录屏里分离人声与音效的可行做法,也把边界说在前面。

游戏音频的特点是「混音层级多」:语音、技能音效、环境音、BGM 常常四个层级叠在一起,而且不同游戏混音风格差异极大。这让分离比歌曲难,因为歌曲至少有「人声对伴奏」这个清晰目标,游戏没有。

提取角色语音

想单独拿台词,用 MDX-Net 的 UVR-MDX-NET Main,它把「像人声的部分」提出来。多数游戏的剧情语音能被较好地分离,因为配音通常居中、频段集中。Overlap 设 0.5,Segment Size 256。如果语音里夹着技能音效的「嘶喊」,会一起被留下来,这是模型把高频音效误判成人声,属常见现象。

对动画演出密集的段落,建议分段处理,因为过场音乐一进来就会污染人声轨。手动把纯对话段切出来再跑,比整段跑完再修更省事。

提取音效与环境

想要技能音效、脚步、环境声,走 Demucs 的 htdemucs_ft 四轨。它的 other 轨会包含大部分音效和氛围,drums 轨可能抓到打击类音效。但游戏音效和音乐常混在同一层,四轨分出的 other 仍带 BGM 味,别指望纯音效。

更现实的目标是「分出相对干净的人声」和「剩下的混合层」,而不是精确的三层。做混剪时,把人声轨去掉、用剩下的层当背景,通常已经够用。

可行与边界

所以游戏音频提取的定位是「降维到可用」,不是「完美分层」。带着这个预期,结果通常能接受。

模型选择对照

想要模型预期
角色语音UVR-MDX-NET Main较干净
混合音效层htdemucs_ft other含 BGM 味
削弱 BGMMain 后再 DeNoise更清楚

下一步建议

下一步,挑一款你常剪的游戏,录一段含对话的录屏,先跑 Main 看语音提得如何,再用四轨看 other 层能不能当背景。把效果最好的组合记在剪辑模板里,下次直接套。游戏混音千变万化,按游戏试比死记参数靠谱。

为什么音效总带一点 BGM

游戏母带常把音效和音乐压进同一层并做动态压缩,AI 看不到「这是音效那是音乐」的标签,只能按频段猜。这种结构性重叠是分离算法的天花板,不是参数没调好。

想要纯技能音效为什么拿不到

游戏常把技能音效和环境音乐压进同一层并做动态压缩,算法没有「这是音效那是音乐」的标注,只能按频段猜。这类结构性重叠是分离上限,换模型或调参都突破不了,只能接受一条混合层,再在剪辑里手动挑你要的段落。