STEMGRABOtwórz narzędzie →
Explorainer · uczciwe wydanie

Jak oddzielenie łodygi AI właściwie roboty

Piosenka jest jak pieczone ciasto: jajka i mąka są tam, ale nie można ich wyciągnąć z powrotem.

Więc jak sieć neuronowa daje ci odizolowany głos z 40-letniej płyty? Oto prawdziwa historia, włącznie z tym, co nadal nie działa.

Pełna jakość łodyg. Nie ma konta, nie ma opłaty. Ten sam model i ten sam 192 kbps (lub bez strat WAV) co wartość płatna — do 15 minut.

Co nasz własny model właściwie robi, mierzy

Przed lekcją historii, liczby z prowadzenia tego modelu sami: w każdym narzędziu na stronie, zrobiliśmy 2,264 separacje w ciągu 40 dni mierzymy, odrzucając 1,336 uploads zanim kiedykolwiek osiągnął model w ogóle — nieprawidłowy format, brak rozszerzenia pliku, lub tor poza pułap długości, a nie oddzielenie się nie udaje. Spośród uploadów, które przechodzą, większość kończy się szybko: backend zalogował typowych uruchomień 2,6 i 2,5 sekundy na jego szybsze zadania (15 i 12 razy odpowiednio w tym oknie), ale długie lub gęste wysyłanie może przepchnąć dobrze, że — Najwolniejsze operacje, które zalogowaliśmy, zajmują ponad dwie minuty, co wciąż stanowi ułamek tego, ile ta sama separacja kosztowałaby wynajęty czas GPU w chmurze. Nic ci to nie mówi. jak działa, choć, lub dlaczego niektóre łodygi wychodzą czystsze niż inne — Oto prawdziwy mechanizm, w tym triki fazowe.

Przed AI: trick faze- cancel

Przez dekady ",zmywacz głosu"oznaczało jedno: fazowa inwersjaW wielu mieszankach wokal ołowiany jest w martwym centrum: identyczny w lewym i prawym kanale. Odwróć polaryzację jednego kanału i sum dwa, i wszystko identyczne w obu kanałach anuluje. Głos znika.

Tak jak wszystko inne w środku: bębny, sidła, basy. To co zostało brzmi pusto i fazowo, jak zespół grający na końcu korytarza. A trik przebiegł tylko w jedną stronę: może (rodzaj) usunąć centrum, ale nigdy nie może izolat sam głos. Nie powiodło się również całkowicie na nagraniach mono, na wokalach z stereo pogłos, i na niczym nie mieszanym dokładnie w dół środka. Anulowanie fazy to była sztuczka, a nie narzędzie.

Era spektrogramu: maskowanie

Pierwsze prawdziwe separatory uczenia się maszyn (około 2015- 2019) pracował na spektrogramy: obraz piosenki pokazujący, które częstotliwości są głośne w każdym momencie. Sieć neuronowa została wyszkolona, by spojrzeć na ten obraz i namalować maska "Te piksele należą do głosu, te należą do bębnów". Pomnóż mieszankę przez maskę, przerób z powrotem na dźwięk, zrobione.

To był skok: nagle można odizolować głos, nie tylko go anulować. Ale maskowanie ma built- w suficie: gdy wokal i gitara zajmują ten sam Częstość występowania ten sam moment (który zdarza się stale w prawdziwej muzyce), maska musi jakoś podzielić tę energię, a rezultatem jest wodnisty, podwodny warble wczesnych użytkowników pamiętać. Spektogramy również wyrzucić Faza informacje, które model następnie musi udawać w drodze powrotnej do audio.

Dzisiaj: hybrydowe modele AI

Nowoczesne separatory (włączając silnik z tyłu) StemGrab) atakować problem z dwóch kierunków na raz (stąd "hybryda"). Którykolwiek termin użyjesz do tego — separator macierzysty, rozdzielacz macierzysty lub separator źródłowy — mechanika pod spodem jest dwukierunkowe podejście opisane poniżej:

Skąd w ogóle wie, czym jest "wokal"? Trening. Model nauczył się od tysięcy piosenek, w których dostępne były prawdziwe odizolowane łodygi, mieszając je razem i oceniając siebie, jak dobrze odzyskał każdą część. Po tym wszystkim, internalizował głosy, kopnięcia, sidła i linie basowe, na tyle dobrze, aby oszacować je na podstawie mieszanek, których nigdy nie słyszał. To nie jest ogólny poradnik o użyciu narzędzi AI do innych zadań — W ten sposób ten model nauczył się rekonstruować głos, bębny i basline z pojedynczego pliku mieszanego.

Kluczowe spostrzeżenie: separacja nie jest "odmieszaniem". Oryginalne multitory zniknęły matematycznie. Model rekonstrukcje Każdy z tych łodyg był najbardziej wiarygodny: bardzo wykształcony strzał, który okazuje się być szokująco dobry.

OLD: FASE- CANCEL TRICKKanał LKanał R · polaryzacja obróconaSUM → pusty, reszta fazykop + bas anulowany zbyt · brak izolowanego wokaluMODERN: SEPARACJA AIVOCALSDRUMSBASSINNEcztery czyste, niezależne ścieżki
Stare vs nowe: faze- anuluje tylko to, co jest dead- center i pozostawia puste, fazey reszta; przeszkolony model szacuje każde źródło jako własne czyste, niezależne ścieżki.
Dlaczego sześć łodyg jest obecny sufit

Klasyczny podział to cztery łodygi: wokale, bębny, basy, pozostałe, ponieważ w ten sposób standardowy zbiór danych badawczych (MUSDB18) jest oznakowany, a modele mogą uczyć się tylko kategorii swoich nazw danych szkoleniowych. Six- step modele jak ten StemGrab działa dodać gitara oraz fortepian, wyrzeźbione z "innych".

Idąc dalej (rozdzielając wokal wiodący od harmonijek za nim, oddzielając gitary, izolując synt), głównie nie jest problemem modelowania, to jest dane Problem. Nie ma dużej publicznej biblioteki piosenek z, powiedzmy, oznakowanym łodygą tamburyny. Dopóki te dane nie istnieją, "wszystko inne" pozostaje przyklejone razem w pozostałe Track.

Dlaczego gitara i fortepian lag za wokalami, bębnami i basem

Łatwe łodygi są łatwe, ponieważ każdy zajmuje charakterystyczną niszę:

Gitara i fortepian to kameleony. Oba zakresy prawie pełny zakres częstotliwości, zarówno grać akordy i melodie, i pokrywają się mocno: ze sobą, z klocków synth, ze strunami, z organów. Czyste pianino i ciepły pad grający ten sam akord są rzeczywiście dwuznaczne nawet dla ludzkich uszu. Dodawanie zniekształceń do gitary i staje się szerokopasmowym szumem-z-smokiem, łatwo mylić z syntami. Dane treningowe dla tych dwóch kategorii są ułamkiem tego, co istnieje dla wokali. Rezultat: na smukłej ścieżce piosenkarki, łodyga gitara może wyjść pięknie; w gęstej mieszance ściennej dźwięku, oczekiwać krwawienia i smugi.

Co nadal jest nie tak, szczerze?

Nic z tego nie oznacza, że technologia jest zła: wokale, perkusje i basy na nowoczesnej mieszance są czystsze, niż ktokolwiek by pomyślał w 2018 roku. To znaczy, że uczciwa propozycja to "niezwykle dobra ocena", a nie "magia".

Usłysz to na własnej muzyce

Najszybszy sposób kalibracji oczekiwań jest prowadzenie ścieżki, którą znasz na wylot. Wrzuć piosenkę do StemGrab: otrzymasz wokal, bębny, bas, gitara, fortepian, inne i czysty instruktor z powrotem w około minutę, za darmo, bez konta. Potem załóż słuchawki i słuchaj, co model zrobił dobrze, i gdzie się domyślił. To jest naprawdę to, co każdy system oddzielania łodyg sprowadza się do końca — Najlepsze przypuszczenie modelki, sprawdzone na własne uszy.

Podziel utwór wolny →

Więcej z StemGrab: ćwicz dowolny instrument z łodygami · co masz prawo zrobić z łodygami, legalnie

Illustrated portret Sama RidderaPrzez Sam Ridder - Buduję i prowadzę StemGrab na własnym sprzęcie. Kim jestem.