基础知识
什么是 AI 人声分离?AI 人声分离是一种利用机器学习模型的工具,模型在海量歌曲上训练而成,能把一首成品歌曲拆成两条分轨:主唱人声和器乐伴奏。
早期工具靠简单的音频技巧去抵消人声,只对极少数录音有效。现代人声分离工具则是真正学会了人声在混音里的样子,直接把它从整首歌里提取出来——所以几乎什么曲风都能处理,从原声民谣到编曲密集的电子乐都不在话下。
AI 人声分离的原理是什么?每首歌都可以画成一张频谱图——记录每个时刻各个频率的能量分布。人声、鼓、贝斯、吉他在图上各有各的纹理。分离模型在庞大的训练曲库中学会了这些纹理,因此能够预测出一张“人声掩码”:频谱图上准确属于歌手的那些区域。
接下来工具把这张掩码用两次——一次只保留人声,得到干声;一次把人声减掉,得到伴奏。两条音轨都是重新还原出来的完整音频,而不是对原曲做了滤波的降质副本。
分轨(Stem)成品歌曲中被单独拆出的一层——人声、鼓、贝斯,或其余部分的合并。人声分离工具输出两条分轨。
干声(Acapella)单独的人声轨:主唱加和声,不含任何乐器。制作人常用干声做混音(Remix)、串烧和采样。
伴奏(Backing Track)去掉人声后的歌曲,也叫卡拉 OK 伴奏或垫乐——鼓、贝斯和旋律全部保留。
人声掩码(Vocal Mask)模型对频谱中哪些区域属于人声的预测。应用这张掩码,就是把歌手和乐队分开的过程。