人声分离 API | UVR5 中文站

人声分离 API,是指把音频源分离能力以接口形式集成进你自己的产品或工作流。它和面向普通用户的在线网页工具不同:网页工具给你点几下就能用,API 则让你用代码批量调用。本页从选型、成本、合规三个角度,帮你决定是接商用 API 还是自己部署开源模型。

两条主要路线

商用 API 的取舍

商用 API 的优势是开箱即用、无需养模型、弹性扩容,适合起步阶段或调用量不稳定的团队。劣势有三:一是持续付费,调用量上来后账单增长明显;二是数据出境,未发布或商业音频要确认供应商的留存与训练条款;三是黑盒,你调不了底层模型参数,只能接受它给的质量。选型时重点比对单次价格、并发上限、输出格式(是否给 wav 和多轨)、以及服务等级协议。

自建开源的取舍

自建以 Demucs 为代表,Meta 开源、波形域模型,htdemucs、htdemucs_ft(四轨质量更高)、htdemucs_6s(六轨,含吉他钢琴)都能用。优势是数据完全本地、可调 Shifts(移位平均,1 或 2)等参数、边际成本趋近于硬件折旧。劣势是前期工程:要准备 GPU 机器、写好预处理和后处理、做并发与队列。若团队有运维能力且调用量大,自建长期更划算。

成本结构对比

维度商用 API自建开源
前期投入低,注册即用高,需 GPU 与工程
边际成本随调用量线性上升趋近硬件折旧
数据走向出网到供应商全程本地
可控性低,参数受限高,可调模型与参数
扩容弹性好需自管资源

合规注意点

第一,音频版权:你处理的素材是否有权分离和再分发,和用哪种技术无关,需自行确认授权。第二,数据条款:商用 API 务必读隐私与训练条款,未发布作品、客户音频优先自建。第三,出口与日志:自建也要管好访问权限和结果留存,避免内部泄露。第四,模型许可:Demucs 等开源模型有各自许可证,商用前核对是否允许商业使用,避免后续纠纷。

从原型到生产的工程要点

无论是接商用 API 还是自建,真正上线前都要补几件事:一是并发与队列,分离是慢任务,要设计异步和回调而非同步等待;二是超时与重试,大文件或模型繁忙时会失败,要有补偿机制;三是结果存储与清理,分离产物可能含敏感音频,要有到期删除策略;四是监控成本,API 调用量或 GPU 时长要设告警。把这些工程细节想清楚,方案才稳。五是做好降级,当主路不可用时有备用模型或队列兜底。

下一步

技术选型确定后,若走自建可参考本站的 Demucs 与桌面版 UVR5 模型说明;若接商用 API,记得回到「在线人声分离隐私」核对数据条款。