FAIXAEXTRAIAAbra a ferramenta →
Explicação · versão completa

Como a separação de faixas com IA realmente funciona

Faixas com qualidade total. Sem necessidade de conta, sem cobrança por faixa.O mesmo modelo e a mesma taxa de 192 kbps (ou WAV sem perdas) da versão paga — faixas de até 15 minutos.

Uma música mixada é como um bolo assado: os ovos e a farinha estão lá, mas você não pode tirá-los de volta. Então, como uma rede neural consegue fornecer a faixa vocal isolada de um disco de 40 anos? Aqui está a história real, incluindo o que ainda não funciona.

Antes da IA: a técnica de cancelamento de fase

Por décadas, "remoção de vocais" significava uma única coisa: inversão de faseEm muitas mixagens, o vocal principal é posicionado exatamente no centro: idêntico nos canais esquerdo e direito. Inverta a polaridade de um dos canais e some os dois, e tudo o que for idêntico em ambos os canais será cancelado. O vocal desaparece.

E o mesmo acontece com todos os outros elementos no centro: a caixa, o bumbo, o baixo. O que resta soa oco e com efeito de fase, como se a banda estivesse tocando no final de um corredor. Além disso, o truque só funcionava em uma direção: ele podia (de certa forma) remover o centro, mas nunca poderia isolar o vocal sozinho. Também falhava completamente em gravações mono, em vocais com reverberação estéreo e em qualquer coisa que não fosse mixada exatamente no centro. A inversão de fase era um truque de festa, não uma ferramenta.

A era do espectrograma: mascaramento

Os primeiros separadores reais baseados em aprendizado de máquina (por volta de 2015–2019) funcionavam com espectrogramasuma imagem da música que mostra quais frequências são altas em cada momento. Uma rede neural era treinada para analisar essa imagem e aplicar uma máscara sobre ela: "estes pixels pertencem à voz, aqueles pertencem aos tambores". Multiplique a mixagem pela máscara, converta de volta para áudio e pronto.

Isso representou um grande avanço: de repente, você podia isolar um vocal, não apenas cancelá-lo. Mas o mascaramento tem um limite inerente: quando um vocal e uma guitarra ocupam as mesmas igual frequência no mesmo momento (o que acontece constantemente na música real), uma máscara precisa dividir essa energia de alguma forma, e o resultado é aquele som abafado e distorcido que todos os primeiros usuários se lembram. Os espectrogramas também descartam a informação de fase, que o modelo então tem que simular no processo de conversão para áudio Atualmente: modelos híbridos com transformadores Separadores modernos como

(incluindo o motor por trás do StemGrab) atacam o problema em duas frentes ao mesmo tempo (daí o termo "híbrido") Uma ramificação da forma de onda trabalha diretamente nas amostras de áudio originais, para que nada seja perdido na conversão para espectrograma, incluindo a fase. É isso que faz com que os graves e as batidas dos arquivos separados modernos tenham mais impacto, em vez de ficarem borrados.

Como ele sabe o que é um "vocal"? Treinamento. O modelo aprendeu com milhares de músicas em que as faixas isoladas originais estavam disponíveis, misturando-as e avaliando seu próprio desempenho na recuperação de cada parte. Após esse processo repetido várias vezes, ele internalizou como sons vocais, bumbos, caixas e linhas de baixo, o suficiente para estimá-los a partir de mixagens que nunca ouviu antes.

Ideia principal: a separação não é uma "desmistura". As faixas originais são matematicamente perdidas. O modelo reconstrói o que cada faixa provavelmente era: um palpite muito bem fundamentado que, por acaso, é surpreendentemente bom.

ANTIGO: TRUQUE DE CANCELAMENTO DE FASECanal esquerdoCanal direito · polaridade invertidaSUM → resíduo oco e com efeito de faseBateria + baixo cancelados · sem vocal isoladoMODERNO: SEPARAÇÃO POR IAVOCAISBATERIABAIXOOUTROSQuatro faixas limpas e independentes
Antigo versus novo: o cancelamento de fase só elimina o que está exatamente no centro, deixando um resíduo oco com efeito de fase; um modelo treinado estima cada fonte como uma faixa limpa e independente.
Por que seis faixas é o limite atual

A divisão clássica é em quatro faixas: vocais, bateria, baixo, outros, porque é assim que o conjunto de dados padrão para pesquisa (MUSDB18) é rotulado, e os modelos só podem aprender categorias com base nos nomes dos dados usados no treinamento. Modelos com seis faixas, como o usado pelo StemGrab, adicionam guitarra e piano, extraído do "resto".

Aprofundar-se (separar a voz principal dos vocais de apoio, dividir as guitarras, isolar o sintetizador) geralmente não é um problema de modelagem, mas sim um problema de dados Não existe uma grande biblioteca pública de músicas com, por exemplo, uma faixa de pandeiro identificada. Até que esses dados existam, "tudo o mais" permanecerá agrupado na faixa original Por que a guitarra e o piano ficam atrás dos vocais, da bateria e do baixo?

As faixas fáceis são fáceis porque cada uma ocupa um nicho distinto

Vocais

Guitarra e piano são instrumentos versáteis. Ambos abrangem quase toda a faixa de frequência, ambos tocam acordes e melodias, e eles se sobrepõem muito: entre si, com timbres de sintetizador, com cordas, com órgão. Um piano limpo e um timbre quente tocando o mesmo acorde são genuinamente ambíguos, até mesmo para ouvidos humanos. Adicione distorção a uma guitarra e ela se torna ruído de banda larga com altura definida, facilmente confundido com sintetizadores. E os dados de treinamento para essas duas categorias representam uma fração do que existe para vocais. O resultado: em uma faixa esparsa de um cantor/compositor, o canal da guitarra pode soar maravilhosamente; em uma mixagem densa e cheia de sons, espere vazamentos e distorções.

O que ainda não está perfeito

Nada disso significa que a tecnologia seja ruim: vocais, bateria e baixo em uma mixagem moderna soam mais limpos do que qualquer um poderia imaginar em 2018. Significa que a avaliação honesta é "uma estimativa notavelmente boa", não "mágica".

Ouça na sua própria música

A maneira mais rápida de ajustar suas expectativas é executar uma faixa que você conhece muito bem. Envie uma música para o StemGrabEm cerca de um minuto, você terá as faixas vocais, bateria, baixo, guitarra, piano e outros instrumentos, além de uma versão instrumental limpa, tudo isso gratuitamente e sem precisar criar uma conta. Coloque seus fones de ouvido e ouça o que o modelo conseguiu identificar corretamente e onde ele errou.

Separe as faixas de áudio gratuitamente →

Mais do StemGrab: Pratique qualquer instrumento com as faixas separadas · O que você pode fazer legalmente com as faixas separadas