SES AYRIŞTIRMASTEMGRABAracı açın →
Açıklayıcı · dürüst sürüm

Yapay zeka ile ses ayrıştırma aslında nasıl

Yüksek kaliteli ses parçaları. Hesap oluşturmanıza veya parça başına ücret ödemenize gerek yok.Ücretli sürümle aynı model ve 192 kbps (veya kayıpsız WAV) kalitesi — en fazla 15 dakikalık şarkılar.

Karışık bir şarkı, pişmiş bir kek gibidir: yumurtalar ve un içinde bulunur, ancak onları geri çekemezsiniz. Peki, yapay sinir ağı 40 yıllık bir kayıttan izole edilmiş vokali size nasıl sunuyor? İşte gerçek hikaye, hala çalışmayan şeyleri de içeriyor.

Yapay zekadan önce: faz kaydırma hilesi

On yıllar boyunca "vokal temizleyici", tek bir şeyi ifade ediyordu: faz ters çevirme. Birçok mikste ana vokal tam ortada olacak şekilde yerleştirilir: sol ve sağ kanalda aynıdır. Bir kanalın polaritesini tersine çevirin ve iki kanalı toplayın, böylece her iki kanaldaki tüm benzer sesler birbirini yok eder. Vokal kaybolur.

Ortadaki diğer her şey de kaybolur: bas davul, trampet, bas gitar. Geriye kalan ses boş ve faz bozulmuş gibi gelir, sanki grup bir koridorun sonunda çalıyormuş gibidir. Ve bu yöntem yalnızca tek yönde işe yarardı: (biraz da olsa) ortadaki sesi kaldırabiliyor, ancak asla vokali tek başına izole edemiyordu. Ayrıca mono kayıtlar, stereo yankılı vokaller ve tam olarak ortada mikslenmemiş herhangi bir şey üzerinde tamamen başarısız oluyordu. Fazı yok etme, bir hileden öteye geçemedi.

Spektrogram çağı: maskeleme

İlk gerçek makine öğrenimi tabanlı ayırıcılar (yaklaşık 2015–2019 yılları arasında), şunlar üzerinde çalışıyordu: spektrogramlar: şarkının hangi frekansların her an ne kadar yüksek olduğunu gösteren bir görüntü. Bir sinir ağı, bu görüntüye bakacak ve üzerine bir maske çizecek şekilde eğitildi: "bu pikseller vokal sesine ait, o pikseller davula ait." Miksi maskeyle çarpın, tekrar sese dönüştürün, işlem tamam.

Bu büyük bir atılımdı: aniden bir vokali sadece yok etmek yerine izole edebiliyordunuz. Ancak maskelemenin doğasında var olan bir sınırlaması vardır: bir vokal ve bir gitar aynı frekans aralığını aynı anda kapladığında (ki bu gerçek müzikte sürekli olarak gerçekleşir), bir maskenin bu enerjiyi bir şekilde bölmesi gerekir ve sonuç, ilk kullanıcıların hatırladığı o sulu, su altı benzeri ses olur. Spektrogramlar ayrıca faz bilgisini de atar; bu bilgiyi model daha sonra sesi yeniden oluştururken taklit etmek zorunda kalır.

Günümüzde: hibrit dönüştürücü modeller

Modern ayırma araçları (arkasındaki model) soruna aynı anda iki farklı yönden saldırır (bu nedenle "hibrit"):

Model, "vokal"in ne olduğunu nasıl anlıyor? Eğitim. Model, gerçek izole parçaların mevcut olduğu binlerce şarkıdan öğrendi; bunları bir araya getirerek ve her parçayı ne kadar iyi geri kazandırdığını değerlendirerek kendini geliştirdi. Yeterince tekrar yaptıktan sonra, seslerin, davul ritmlerinin, trampetlerin ve bas çizgilerinin nasıl duyulduğunu içselleştirdi ve daha önce hiç duymadığı karışımlardan bile bunları tahmin edebilecek hale geldi.

Önemli nokta: ayırma, "karışımı çözme" değildir. Orijinal çok kanallı parçalar matematiksel olarak kaybolmuştur. Model, yeniden oluşturur her bir parçanın en olası halini: son derece isabetli bir tahmindir ve şaşırtıcı derecede iyidir.

ESKİ YÖNTEM: FAZ KAYDIRMA HİLESİL kanalıR kanalı · polarite ters çevrildiTOPLAM → boşluklu, faz kaymalı kalıntıbas ve davul sesleri de ayrıldı · izole edilmiş vokal yokMODERN: YZ AYIRIMIVOKALLERDAVULLARBASDİĞERdört adet temiz, bağımsız parça
Eskiye karşı yeni: faz iptali yalnızca tam ortadaki sesi iptal eder ve boşluklu, faz kaymalı bir kalıntı bırakır; eğitilmiş bir model her kaynağı kendi başına temiz, bağımsız bir parça olarak tahmin eder.
Şu anda altı parçanın neden üst sınır olduğu

Klasik ayrım dört parçadır: vokaller, davullar, bas, diğerçünkü standart araştırma veri kümesi (MUSDB18) bu şekilde etiketlenmiştir ve modeller yalnızca eğitim verilerinde yer alan kategorileri öğrenebilir. StemGrab'in kullandığı gibi altı parçalı modeller şunları ekler gitar ve piyano, diğer seslerden ayrıştırılmış.

Daha ileri giderek (ana vokali arka vokalden ayırmak, gitarları bölmek, synthesizer'ı izole etmek), genellikle bir modelleme problemi değildir; daha çok bir veri problemidir. Örneğin, etiketlenmiş bir tef parçası içeren geniş ve kamuya açık bir şarkı kütüphanesi bulunmamaktadır. Bu veri mevcut olana kadar "diğer her şey" içinde diğer parçada birbirine bağlı kalır.

Neden gitar ve piyano, vokallerden, davullardan ve bas gitardan daha geride kalıyor

Kolay ayrıştırılabilen sesler kolaydır çünkü her biri belirgin bir alana sahiptir:

Gitar ve piyano, çok yönlü enstrümanlardır. Her ikisi de neredeyse tüm frekans aralığını kapsar, hem akorlar hem de melodiler çalarlar ve büyük ölçüde birbirleriyle, synth sesleri, yaylı çalgılar ve org ile örtüşürler. Aynı akoru çalan temiz bir piyano ve sıcak bir synth sesi, insan kulağı için bile ayırt edilmesi zor olabilir. Bir gitara distorsiyon eklendiğinde, geniş bantlı gürültüye dönüşür ve kolayca synth sesleriyle karıştırılabilir. Bu iki kategori için kullanılan eğitim verisi ise vokal için olanın çok daha azıdır. Sonuç: seyrek bir şarkı yazarı parçası üzerinde gitar sesi harika çıkabilirken, yoğun bir müzik karışımında istenmeyen sesler ve bulanıklıklar oluşabilir.

Dürüst olmak gerekirse, hala nelerin yanlış gittiği

Bunların hiçbiri teknolojinin kötü olduğu anlamına gelmez: modern bir müzik karışımında vokaller, davullar ve bas daha temiz çıkıyor ve bu durum 2018'de kimsenin hayal edemeyeceği kadar iyi bir sonuçtur. Bu, gerçekçi beklentinin "şaşırtıcı derecede iyi bir tahmin" olduğu, "sihir" olmadığı anlamına gelir.

Kendi müziğinizde dinleyin

Beklentilerinizi ayarlamanın en hızlı yolu, bildiğiniz bir parçayı çalmaktır. Bir şarkıyı StemGrab'a yükleyinBirkaç dakika içinde vokal, davul, bas gitar, gitar, piyano ve diğer enstrümanlardan oluşan parçaları ayrı ayrı elde edebilir, temiz bir enstrümantal versiyonu dinleyebilirsiniz; hepsi ücretsiz ve hesap oluşturmanıza gerek yok. Ardından kulaklıklarınızı takın ve modelin nerede doğru tahminlerde bulunduğunu ve nerede yanıldığını dinleyin.

Bir şarkıyı ücretsiz olarak parçalara ayırın →

StemGrab'den daha fazlası: Herhangi bir enstrümanı parçalarla birlikte çalışarak öğrenin · Parçaları yasal olarak ne şekilde kullanabilirsiniz