提供高质量的音轨。无需注册账户,也不需要为每首歌曲付费。与付费版本使用相同的模型和 192 kbps(或无损 WAV)音质——支持时长不超过 15 分钟的歌曲。
一首混音歌曲就像一个烤好的蛋糕:鸡蛋和面粉都在里面,但你无法将它们分离出来。那么,神经网络又是如何从一首 40 年前的老歌中提取出独立的声乐部分呢?以下是真实的故事,包括目前仍然存在的问题。
多年来,“人声去除”这个词只有一个含义: 相位反转。在许多混音中,主唱通常被放置在正中间:左右声道完全相同。翻转其中一个声道极性并将其与另一个声道相加,两个声道中所有相同的部分都会相互抵消。这样人声就会消失。
同样会发生其他情况:鼓、军鼓和贝斯等位于中心的声音也会消失。剩下的声音听起来空洞而失真,就像乐队在走廊尽头演奏一样。而且这种方法只能单向使用:它(勉强)可以 去除 中心部分的声音,但永远无法 隔离 单独的人声。此外,它对单声道录音、带有立体混响的人声以及任何没有精确地混合到中心位置的音频都完全无效。相位抵消只是一种花招,而不是一种工具。
第一批真正的机器学习分离器(大约在 2015 年至 2019 年间出现)基于 光谱图工作:这是一种音频图像,显示了每个时刻哪些频率的声音最响。通过训练神经网络来分析该图像,并绘制一个 遮罩 图层覆盖在上面:“这些像素属于人声,那些像素属于鼓声。”将混音与遮罩图相乘,然后转换回音频,完成。
这是一次飞跃:突然间,你可以隔离人声,而不仅仅是将其消除。但是,遮罩处理存在固有的局限性:当人声和吉他同时占据相同的 相同 在同一 时刻的 频率(这种现象在真实的音乐中会不断发生),因此,必须以某种方式将能量分散开来,结果就是早期用户都记得的那种水声、水下颤音。同时,频谱图也会丢弃 相位 信息,然后模型在将其转换回音频时需要进行模拟。
现代分离器(包括 StemGrab 背后的引擎)从两个方向同时解决问题(因此称为”混合”):
它怎么知道什么是“人声”呢? 通过训练。 该模型通过数千首歌曲进行学习,这些歌曲提供了真实的独立音轨,并将它们混合在一起,然后根据其恢复每个部分的效果对自身进行评分。经过足够多的训练后,它已经掌握了人声、鼓点、响板和低音线听起来的样子,足以从它从未听过的混音中推断出这些声音。
关键见解: 分离不是“反向混合”。原始的多轨音频在数学上已经消失。该模型 重构 每个音轨最有可能是什么:这是一种非常精明的猜测,结果却令人惊讶地准确。
经典的分割方式是四个音轨: 人声、鼓、低音、其他这是因为标准的科研数据集(MUSDB18)就是这样标注的,模型只能学习其训练数据中包含的类别。像 StemGrab 使用的六音轨模型会增加 吉他 和 钢琴,从“其他”音轨中分离出来。
更进一步(将主唱与伴唱分开、分割吉他音轨、隔离合成器),这通常不是一个建模问题,而是一个 数据 问题。目前没有大型公共音乐库,其中包含带有标记的铃鼓音轨等内容。在拥有这些数据之前,“其他所有内容”都会保持在一个 音轨中。 为什么吉他和钢琴的处理效果不如人声、鼓和贝斯?
人声
吉他和钢琴就像变色龙一样。 两者都几乎涵盖了完整的频率范围,都能演奏和弦和旋律,而且它们之间存在很大的重叠:彼此之间、与合成器音垫、与弦乐、与管风琴之间。一首干净的钢琴曲和一首温暖的音垫同时演奏相同的和弦,即使是人类也难以分辨。给吉他添加失真效果后,它会变成宽频带噪音,很容易与合成器混淆。而且,这两类音乐的训练数据仅占现有歌曲数据的很小一部分。结果:在一首旋律简单的歌手创作歌曲中,吉他音轨可以呈现出非常好的效果;但在一首声音密集的混合乐曲中,可能会出现串音和模糊。
这并不意味着这项技术很差:在现代音乐的混合中,人声、鼓和贝斯的表现比人们在2018年所认为的要好得多。这意味着它的真实效果是“非常好的近似”,而不是“魔法”。
调整期望值的最快方法是在一首你非常熟悉的歌曲上进行测试。 将一首歌导入 StemGrab您只需一分钟左右的时间,即可免费获得人声、鼓点、贝斯、吉他、钢琴和其他乐器以及纯伴奏音轨,无需注册账户。戴上耳机,聆听模型正确识别的部分,以及它猜测错误的地方。
StemGrab的其他功能: 使用分离的音轨练习任何乐器 · 您可以合法地对分离的音轨进行哪些操作