PISTES SÉPARÉESTÉLÉCHARGEROuvrez l’outil →
Explication · version honnête

Comment fonctionne la séparation des pistes par IA En réalité, comment ça marche

Des pistes de qualité supérieure. Pas besoin de compte, pas de frais par piste.Le même modèle et le même débit binaire de 192 kbps (ou WAV sans perte) que la version payante, pour des morceaux allant jusqu’à 15 minutes.

Une chanson mixée est comme un gâteau cuit : les œufs et la farine sont présents, mais on ne peut pas les extraire. Alors, comment un réseau neuronal parvient-il à isoler la voix d’un enregistrement de 40 ans ? Voici l’histoire vraie, y compris ce qui ne fonctionne toujours pas.

Avant l’IA : la technique d’annulation de phase

Pendant des décennies, l’expression « supprimer la voix d’une chanson » signifiait une seule chose : l’inversion de phaseDans de nombreux enregistrements, la voix principale est centrée : elle est identique dans les canaux gauche et droit. Inversez la polarité d’un canal et additionnez les deux, et tout ce qui est identique dans les deux canaux s’annule. La voix disparaît.

De même que tous les autres éléments situés au centre : la grosse caisse, la caisse claire, la basse. Ce qui reste sonne creux et déphasé, comme si le groupe jouait au fond d’un couloir. Et cette astuce ne fonctionnait que dans un seul sens : elle pouvait (plus ou moins) supprimer le centre, mais elle ne pouvait jamais isoler la voix seule. Elle échouait également complètement sur les enregistrements mono, sur les voix avec réverbération stéréo et sur tout ce qui n’était pas mixé exactement au centre. L’annulation de phase était un simple tour de passe-passe, pas un outil.

L’ère du spectrogramme : le masquage

Les premiers véritables séparateurs basés sur l’apprentissage automatique (vers 2015–2019) fonctionnaient sur des spectrogrammesune image de la chanson qui montre quelles fréquences sont fortes à chaque instant. Un réseau neuronal était entraîné pour analyser cette image et appliquer un masque « ces pixels appartiennent à la voix, ceux-ci aux percussions ». Multipliez le mix par le masque, reconvertissez en audio, c’est fait.

Cela a constitué une avancée considérable : soudainement, vous pouviez isoler une voix, et pas seulement l’annuler. Mais le masquage a une limite inhérente : lorsqu’une voix et une guitare occupent les identique fréquence au même moment (ce qui se produit constamment dans la musique réelle), un masque doit diviser cette énergie d’une manière ou d’une autre, et le résultat est ce son aquatique et distordu dont se souviennent tous les premiers utilisateurs. Les spectrogrammes suppriment également l’information sur la phase, que le modèle doit ensuite simuler lors du retour au format audio Aujourd'hui : modèles hybrides à transformateurs

Les séparateurs modernes comme

Les séparateurs modernes (dont le moteur derrière StemGrab) abordent le problème simultanément sous deux angles (d’où le terme « hybride ») Une branche basée sur la forme d’onde travaille directement sur les échantillons audio bruts, de sorte que rien n’est perdu lors d’une conversion en spectrogramme, y compris la phase. C’est ce qui permet aux pistes séparées modernes pour la basse et la batterie d’avoir un son percutant plutôt qu’un effet diffus.

Comment sait-il ce qu’est une « voix » ? Entraînement. Le modèle a appris à partir de milliers de chansons où les pistes séparées réelles étaient disponibles, en les mélangeant et en s’évaluant sur la qualité avec laquelle il reconstituait chaque partie. Après avoir répété cette opération un certain nombre de fois, il a internalisé ce que sonnent les voix, les rythmes de batterie, les caisses claires et les lignes de basse, suffisamment pour pouvoir les estimer à partir de morceaux qu’il n’a jamais entendus.

Idée clé : la séparation n’est pas un « démélange ». Les pistes multiformes originales ont disparu mathématiquement. Le modèle reconstruit ce que chaque piste était le plus probablement : une estimation très précise qui se révèle étonnamment bonne.

ANCIENNE MÉTHODE : ASTUCE D’ANNULATION DE PHASECanal gaucheCanal droit · polarité inverséeSUM → son creux et déphaséla batterie et la basse sont également supprimées · pas de voix isoléeMODERNE : SÉPARATION PAR IALA VOIXLES PERCUSSIONSLA BASSEAUTREquatre pistes indépendantes et propres
Ancien versus nouveau : la suppression par déphasage ne supprime que ce qui se trouve au centre et laisse un son creux et déphasé ; un modèle entraîné estime chaque source comme une piste indépendante propre.
Pourquoi six pistes sont-elles le nombre maximal actuel

La séparation classique consiste en quatre pistes : la voix, les percussions, la basse, autrecar c’est ainsi que l’ensemble de données de référence standard (MUSDB18) est étiqueté, et les modèles ne peuvent apprendre que les catégories pour lesquelles leurs données d’entraînement sont nommées. Les modèles à six pistes, comme celui utilisé par StemGrab, ajoutent la guitare et piano, extrait de « autre ».

Aller plus loin (séparer la voix principale des chœurs, diviser les guitares, isoler le synthétiseur) n’est généralement pas un problème de modélisation, mais plutôt un problème de données. Il n’existe pas de vaste bibliothèque publique de chansons contenant, par exemple, une piste séparée du tambourin clairement identifiée. Tant que ces données n’existeront pas, « tout le reste » restera regroupé dans la autre piste Pourquoi la guitare et le piano sont-ils moins faciles à isoler que la voix, la batterie et la basse ?

Les pistes séparées les plus simples à extraire le sont parce que chacune occupe une niche bien distincte

La voix

La guitare et le piano sont des instruments caméléons. Les deux couvrent presque toute la gamme de fréquences, les deux jouent des accords et des mélodies, et ils se chevauchent beaucoup : entre eux, avec les nappes synthétiques, avec les cordes, avec l’orgue. Un piano clair et une nappe chaleureuse jouant le même accord sont réellement ambigus, même pour l'oreille humaine. Si vous ajoutez de la distorsion à une guitare, elle devient un bruit large bande avec une hauteur perceptible, facilement confondable avec des synthés. De plus, les données d’entraînement pour ces deux catégories ne représentent qu’une fraction de ce qui existe pour la voix. Le résultat : sur un morceau épuré de musique folk, la piste de guitare peut ressortir magnifiquement ; dans un mix dense et saturé, attendez-vous à des interférences et un flou sonore.

Qu'est-ce qui ne fonctionne toujours pas, honnêtement

Cela ne signifie pas que la technologie est mauvaise : la voix, la batterie et la basse d’un mix moderne ressortent plus clairement que ce qu’on aurait pu imaginer en 2018. Cela signifie simplement que l’estimation honnête est « remarquablement bonne », et non « magique ».

Écoutez-le avec votre propre musique

Le moyen le plus rapide d’ajuster vos attentes est de tester un morceau que vous connaissez parfaitement. Téléchargez une chanson dans StemGrabEn environ une minute, vous obtiendrez la voix, la batterie, la basse, la guitare, le piano, les autres instruments et une piste d'accompagnement instrumentale propre, gratuitement et sans avoir besoin de créer un compte. Ensuite, mettez vos écouteurs et écoutez ce que le modèle a réussi à extraire correctement, ainsi que ses erreurs.

Séparez une chanson gratuitement →

Découvrez StemGrab : Entraînez-vous à jouer d'un instrument avec les pistes séparées · Ce que vous avez le droit de faire avec les pistes séparées, légalement