Piosenka jest jak pieczone ciasto: jajka i mąka są tam, ale nie można ich wyciągnąć z powrotem.
Więc jak sieć neuronowa daje ci odizolowany głos z 40-letniej płyty? Oto prawdziwa historia, włącznie z tym, co nadal nie działa.
Pełna jakość łodyg. Nie ma konta, nie ma opłaty. Ten sam model i ten sam 192 kbps (lub bez strat WAV) co wartość płatna — do 15 minut.
Przed lekcją historii, liczby z prowadzenia tego modelu sami: w każdym narzędziu na stronie, zrobiliśmy 2,264 separacje w ciągu 40 dni mierzymy, odrzucając 1,336 uploads zanim kiedykolwiek osiągnął model w ogóle — nieprawidłowy format, brak rozszerzenia pliku, lub tor poza pułap długości, a nie oddzielenie się nie udaje. Spośród uploadów, które przechodzą, większość kończy się szybko: backend zalogował typowych uruchomień 2,6 i 2,5 sekundy na jego szybsze zadania (15 i 12 razy odpowiednio w tym oknie), ale długie lub gęste wysyłanie może przepchnąć dobrze, że — Najwolniejsze operacje, które zalogowaliśmy, zajmują ponad dwie minuty, co wciąż stanowi ułamek tego, ile ta sama separacja kosztowałaby wynajęty czas GPU w chmurze. Nic ci to nie mówi. jak działa, choć, lub dlaczego niektóre łodygi wychodzą czystsze niż inne — Oto prawdziwy mechanizm, w tym triki fazowe.
Przez dekady ",zmywacz głosu"oznaczało jedno: fazowa inwersjaW wielu mieszankach wokal ołowiany jest w martwym centrum: identyczny w lewym i prawym kanale. Odwróć polaryzację jednego kanału i sum dwa, i wszystko identyczne w obu kanałach anuluje. Głos znika.
Tak jak wszystko inne w środku: bębny, sidła, basy. To co zostało brzmi pusto i fazowo, jak zespół grający na końcu korytarza. A trik przebiegł tylko w jedną stronę: może (rodzaj) usunąć centrum, ale nigdy nie może izolat sam głos. Nie powiodło się również całkowicie na nagraniach mono, na wokalach z stereo pogłos, i na niczym nie mieszanym dokładnie w dół środka. Anulowanie fazy to była sztuczka, a nie narzędzie.
Pierwsze prawdziwe separatory uczenia się maszyn (około 2015- 2019) pracował na spektrogramy: obraz piosenki pokazujący, które częstotliwości są głośne w każdym momencie. Sieć neuronowa została wyszkolona, by spojrzeć na ten obraz i namalować maska "Te piksele należą do głosu, te należą do bębnów". Pomnóż mieszankę przez maskę, przerób z powrotem na dźwięk, zrobione.
To był skok: nagle można odizolować głos, nie tylko go anulować. Ale maskowanie ma built- w suficie: gdy wokal i gitara zajmują ten sam Częstość występowania ten sam moment (który zdarza się stale w prawdziwej muzyce), maska musi jakoś podzielić tę energię, a rezultatem jest wodnisty, podwodny warble wczesnych użytkowników pamiętać. Spektogramy również wyrzucić Faza informacje, które model następnie musi udawać w drodze powrotnej do audio.
Nowoczesne separatory (włączając silnik z tyłu) StemGrab) atakować problem z dwóch kierunków na raz (stąd "hybryda"). Którykolwiek termin użyjesz do tego — separator macierzysty, rozdzielacz macierzysty lub separator źródłowy — mechanika pod spodem jest dwukierunkowe podejście opisane poniżej:
Skąd w ogóle wie, czym jest "wokal"? Trening. Model nauczył się od tysięcy piosenek, w których dostępne były prawdziwe odizolowane łodygi, mieszając je razem i oceniając siebie, jak dobrze odzyskał każdą część. Po tym wszystkim, internalizował głosy, kopnięcia, sidła i linie basowe, na tyle dobrze, aby oszacować je na podstawie mieszanek, których nigdy nie słyszał. To nie jest ogólny poradnik o użyciu narzędzi AI do innych zadań — W ten sposób ten model nauczył się rekonstruować głos, bębny i basline z pojedynczego pliku mieszanego.
Kluczowe spostrzeżenie: separacja nie jest "odmieszaniem". Oryginalne multitory zniknęły matematycznie. Model rekonstrukcje Każdy z tych łodyg był najbardziej wiarygodny: bardzo wykształcony strzał, który okazuje się być szokująco dobry.
Klasyczny podział to cztery łodygi: wokale, bębny, basy, pozostałe, ponieważ w ten sposób standardowy zbiór danych badawczych (MUSDB18) jest oznakowany, a modele mogą uczyć się tylko kategorii swoich nazw danych szkoleniowych. Six- step modele jak ten StemGrab działa dodać gitara oraz fortepian, wyrzeźbione z "innych".
Idąc dalej (rozdzielając wokal wiodący od harmonijek za nim, oddzielając gitary, izolując synt), głównie nie jest problemem modelowania, to jest dane Problem. Nie ma dużej publicznej biblioteki piosenek z, powiedzmy, oznakowanym łodygą tamburyny. Dopóki te dane nie istnieją, "wszystko inne" pozostaje przyklejone razem w pozostałe Track.
Łatwe łodygi są łatwe, ponieważ każdy zajmuje charakterystyczną niszę:
Gitara i fortepian to kameleony. Oba zakresy prawie pełny zakres częstotliwości, zarówno grać akordy i melodie, i pokrywają się mocno: ze sobą, z klocków synth, ze strunami, z organów. Czyste pianino i ciepły pad grający ten sam akord są rzeczywiście dwuznaczne nawet dla ludzkich uszu. Dodawanie zniekształceń do gitary i staje się szerokopasmowym szumem-z-smokiem, łatwo mylić z syntami. Dane treningowe dla tych dwóch kategorii są ułamkiem tego, co istnieje dla wokali. Rezultat: na smukłej ścieżce piosenkarki, łodyga gitara może wyjść pięknie; w gęstej mieszance ściennej dźwięku, oczekiwać krwawienia i smugi.
Nic z tego nie oznacza, że technologia jest zła: wokale, perkusje i basy na nowoczesnej mieszance są czystsze, niż ktokolwiek by pomyślał w 2018 roku. To znaczy, że uczciwa propozycja to "niezwykle dobra ocena", a nie "magia".
Najszybszy sposób kalibracji oczekiwań jest prowadzenie ścieżki, którą znasz na wylot. Wrzuć piosenkę do StemGrab: otrzymasz wokal, bębny, bas, gitara, fortepian, inne i czysty instruktor z powrotem w około minutę, za darmo, bez konta. Potem załóż słuchawki i słuchaj, co model zrobił dobrze, i gdzie się domyślił. To jest naprawdę to, co każdy system oddzielania łodyg sprowadza się do końca — Najlepsze przypuszczenie modelki, sprawdzone na własne uszy.
Więcej z StemGrab: ćwicz dowolny instrument z łodygami · co masz prawo zrobić z łodygami, legalnie
Przez Sam Ridder - Buduję i prowadzę StemGrab na własnym sprzęcie. Kim jestem.