PISTAEXTRAEAbre la herramienta →
Explicación · versión sin adornos

Cómo funciona la separación de pistas con IA en realidad funciona

Pistas de calidad completa. Sin necesidad de cuenta, sin coste por pista.El mismo modelo y la misma calidad de 192 kbps (o WAV sin pérdidas) que la versión de pago: canciones de hasta 15 minutos.

Una canción mezclada es como un pastel horneado: los huevos y la harina están ahí, pero no puedes sacarlos. Entonces, ¿cómo puede una red neuronal proporcionarte la voz aislada de un disco de hace 40 años? Aquí está la verdadera historia, incluyendo lo que todavía no funciona.

Antes de la IA: el truco de la cancelación de fase

Durante décadas, "eliminar la voz" significaba una sola cosa: inversión de faseEn muchas mezclas, la voz principal se sitúa exactamente en el centro: idéntica en los canales izquierdo y derecho. Invierte la polaridad de un canal y suma ambos, y todo lo que sea idéntico en ambos canales se anula. La voz desaparece.

Y también desaparece todo lo demás que esté en el centro: la caja, el bombo, el bajo. Lo que queda suena hueco y con efecto de fase, como si la banda estuviera tocando al final de un pasillo. Además, este truco solo funcionaba en una dirección: podía (más o menos) eliminar el centro, pero nunca podía aislar la voz por sí sola. Tampoco funcionaba en absoluto con grabaciones mono, con voces que tuvieran reverberación estéreo ni con nada que no estuviera mezclado exactamente en el centro. La anulación de fase era un truco de fiesta, no una herramienta.

La era del espectrograma: enmascaramiento

Los primeros separadores reales basados en aprendizaje automático (alrededor de 2015-2019) funcionaban con espectrogramasuna imagen de la canción que muestra qué frecuencias son fuertes en cada momento. Se entrenó una red neuronal para que analizara esa imagen y aplicara una máscara sobre ella: "estos píxeles pertenecen a la voz, esos a la batería". Multiplica la mezcla por la máscara, conviértela de nuevo en audio y listo.

Esto supuso un gran avance: de repente, podías aislar una voz, no solo eliminarla. Pero el enmascaramiento tiene un límite inherente: cuando una voz y una guitarra ocupan las mismas igual frecuencia en el mismo momento (lo cual ocurre constantemente en la música real), una máscara tiene que dividir esa energía de alguna manera, y el resultado es ese sonido acuático y distorsionado que todos los primeros usuarios recuerdan. Los espectrogramas también descartan información de fase, que el modelo luego debe simular al volver a convertirlo en audio.

Hoy: modelos híbridos de IA

Separadores modernos (incluido el motor detrás de) atacan el problema desde dos direcciones simultáneamente (de ahí el término "híbrido") StemGrabUna

¿Cómo sabe siquiera qué es una "voz"? Entrenamiento. El modelo aprendió de miles de canciones donde estaban disponibles las pistas originales aisladas, mezclándolas y evaluándose a sí mismo en función de lo bien que recuperaba cada parte. Después de suficientes iteraciones, ha internalizado cómo suenan las voces, los bombos, las cajas y las líneas de bajo, hasta el punto de poder estimarlos a partir de mezclas que nunca ha escuchado.

Idea clave: la separación no es una "desmezcla". Las pistas originales se han perdido matemáticamente. El modelo reconstruye lo que cada pista probablemente era: una suposición muy fundamentada que resulta ser sorprendentemente buena.

ANTIGUO: TRUCO DE CANCELACIÓN DE FASECanal LCanal R · polaridad invertidaSUM → sonido hueco y con fase desplazadase eliminan los graves y el bombo · no hay voz aisladaMODERNO: SEPARACIÓN CON IAVOCESBATERÍABAJOOTROScuatro pistas independientes y limpias
Antiguo frente a nuevo: la cancelación de fase solo elimina lo que está en el centro y deja un sonido hueco con fase desplazada; un modelo entrenado estima cada fuente como una pista independiente y limpia.
Por qué seis pistas es el límite actual

La división clásica es en cuatro pistas: voces, batería, bajo, otrosporque así se etiqueta el conjunto de datos estándar para la investigación (MUSDB18), y los modelos solo pueden aprender las categorías que se nombran en sus datos de entrenamiento. Los modelos de seis pistas, como el que utiliza StemGrab, añaden guitarra y piano, extraído de "lo demás".

Profundizar (separar la voz principal de las voces de acompañamiento, dividir las guitarras, aislar el sintetizador) no suele ser un problema de modelado, sino un problema de datos No existe una gran biblioteca pública de canciones con, por ejemplo, una pista de pandereta etiquetada. Hasta que existan esos datos, "todo lo demás" seguirá unido en la pista original ¿Por qué la guitarra y el piano se quedan atrás en comparación con las voces, la batería y el bajo?

Las pistas fáciles son fáciles porque cada una ocupa un nicho distintivo

Voces

La guitarra y el piano son instrumentos versátiles. Ambos abarcan casi todo el rango de frecuencias, ambos interpretan acordes y melodías, y se superponen mucho: entre sí, con los sonidos sintetizados, con las cuerdas, con el órgano. Un piano limpio y un sonido cálido que reproduce el mismo acorde son realmente ambiguos, incluso para el oído humano. Si le añades distorsión a una guitarra, se convierte en ruido de banda ancha con tono, que fácilmente puede confundirse con los sintetizadores. Además, la cantidad de datos de entrenamiento para estas dos categorías es solo una fracción de lo que existe para las voces. El resultado: en una pista escasa de un cantautor, la pista de guitarra puede sonar maravillosamente; en una mezcla densa y compleja, espera que haya interferencias y distorsión.

¿Qué sigue fallando

Ninguno de estos problemas significa que la tecnología sea mala: las voces, la batería y el bajo en una mezcla moderna suenan más limpios de lo que nadie habría creído posible en 2018. Significa que la realidad es que ofrece una "estimación notablemente buena", no "magia".

Escúchalo con tu propia música

La forma más rápida de calibrar tus expectativas es probar con una canción que conozcas a la perfección. Sube una canción a StemGrabEn aproximadamente un minuto, obtendrás las pistas de voz, batería, bajo, guitarra, piano y otros instrumentos, además de una pista instrumental limpia, todo ello de forma gratuita y sin necesidad de registrarte. Luego, ponte los auriculares y escucha qué aspectos ha interpretado correctamente el modelo y en cuáles se ha equivocado.

Separa una canción gratis →

Más herramientas de StemGrab: Practica cualquier instrumento con pistas separadas · Qué puedes hacer legalmente con las pistas separadas