游戏音效提取:从录屏分离人声与音效 | UVR5 中文站
游戏音效提取的需求很具体:要么想单独拿角色语音做字幕剪辑,要么想保留技能音效去掉对话,要么想把 BGM 和音效分层。本文讲用 UVR5 从游戏录屏里分离人声与音效的可行做法,也把边界说在前面。
游戏音频的特点是「混音层级多」:语音、技能音效、环境音、BGM 常常四个层级叠在一起,而且不同游戏混音风格差异极大。这让分离比歌曲难,因为歌曲至少有「人声对伴奏」这个清晰目标,游戏没有。
提取角色语音
想单独拿台词,用 MDX-Net 的 UVR-MDX-NET Main,它把「像人声的部分」提出来。多数游戏的剧情语音能被较好地分离,因为配音通常居中、频段集中。Overlap 设 0.5,Segment Size 256。如果语音里夹着技能音效的「嘶喊」,会一起被留下来,这是模型把高频音效误判成人声,属常见现象。
对动画演出密集的段落,建议分段处理,因为过场音乐一进来就会污染人声轨。手动把纯对话段切出来再跑,比整段跑完再修更省事。
提取音效与环境
想要技能音效、脚步、环境声,走 Demucs 的 htdemucs_ft 四轨。它的 other 轨会包含大部分音效和氛围,drums 轨可能抓到打击类音效。但游戏音效和音乐常混在同一层,四轨分出的 other 仍带 BGM 味,别指望纯音效。
更现实的目标是「分出相对干净的人声」和「剩下的混合层」,而不是精确的三层。做混剪时,把人声轨去掉、用剩下的层当背景,通常已经够用。
可行与边界
- 能做:角色对白单独提出来做字幕版剪辑。
- 能做:削弱 BGM 让语音更清楚。
- 边界:精确分离「技能音效」和「环境音」基本做不到,它们同一层。
- 边界:唱歌型角色曲和配音混在一起的,人声轨会带旋律。
所以游戏音频提取的定位是「降维到可用」,不是「完美分层」。带着这个预期,结果通常能接受。
模型选择对照
| 想要 | 模型 | 预期 |
|---|---|---|
| 角色语音 | UVR-MDX-NET Main | 较干净 |
| 混合音效层 | htdemucs_ft other | 含 BGM 味 |
| 削弱 BGM | Main 后再 DeNoise | 更清楚 |
下一步建议
下一步,挑一款你常剪的游戏,录一段含对话的录屏,先跑 Main 看语音提得如何,再用四轨看 other 层能不能当背景。把效果最好的组合记在剪辑模板里,下次直接套。游戏混音千变万化,按游戏试比死记参数靠谱。
为什么音效总带一点 BGM
游戏母带常把音效和音乐压进同一层并做动态压缩,AI 看不到「这是音效那是音乐」的标签,只能按频段猜。这种结构性重叠是分离算法的天花板,不是参数没调好。
想要纯技能音效为什么拿不到
游戏常把技能音效和环境音乐压进同一层并做动态压缩,算法没有「这是音效那是音乐」的标注,只能按频段猜。这类结构性重叠是分离上限,换模型或调参都突破不了,只能接受一条混合层,再在剪辑里手动挑你要的段落。