STEMGRABउपकरण खोलें →
Explainer · ईमानदार संस्करण

कैसे एआई स्टेम अलगाव वास्तव में काम

एक मिश्रित गीत एक बेक्ड केक की तरह है: अंडे और आटे वहाँ हैं, लेकिन आप उन्हें वापस नहीं खींच सकते हैं।

तो एक तंत्रिका नेटवर्क आपको 40 वर्षीय रिकॉर्ड से पृथक स्वर कैसे सौंपता है? यहां वास्तविक कहानी है, जिसमें अभी भी काम नहीं करता है।

पूर्ण गुणवत्ता वाले तने। कोई खाता नहीं, प्रति ट्रैक शुल्क नहीं। उसी मॉडल और उसी 192 kbps (या हानिरहित WAV) भुगतान टियर के रूप में — 15 मिनट तक चलता है।

वास्तव में हमारे अपने मॉडल क्या करता है, मापा

इतिहास के पाठ से पहले, इस मॉडल को चलाने से संख्या स्वयं: साइट पर हर उपकरण में, हमने 40 दिनों में 2,264 अलगावों को चलाया है, जिसे हम माप रहे हैं, 1,336 अपलोड को अस्वीकार कर रहे हैं इससे पहले कि वे कभी भी मॉडल तक पहुंचे सभी मॉडल पर सभी मॉडल पर पहुंच गए हैं। — गलत प्रारूप, कोई फ़ाइल एक्सटेंशन, या लंबाई टोपी के अतीत में एक ट्रैक नहीं, अलगाव स्वयं विफल नहीं है। उन अपलोडों में से जो गुजरते हैं, सबसे तेज़ी से समाप्त होते हैं: बैकेंड ने अपनी त्वरित नौकरियों पर 2.6 और 2.5 सेकंड के विशिष्ट रनों को लॉग किया है (15 और 12 बार क्रमशः उस विंडो में), लेकिन एक लंबे या घने अपलोड अच्छी तरह से अतीत में धक्का दे सकता है कि यह काफी तेज़ है। — सबसे धीमी गति से हम लॉग इन किया है दो मिनट से अधिक ले लो, जो अभी भी एक ही अलग होने का एक अंश है जो किराए पर लिया बादल GPU समय पर खर्च होगा। इसमें से कोई भी आपको बताता है कैसे यह काम करता है, हालांकि, या क्यों कुछ स्टेम दूसरों की तुलना में क्लीनर बाहर आते हैं — इसके लिए, यहां वास्तविक तंत्र, चरण चाल शामिल हैं।

एआई से पहले: चरण-कैसेल चाल

दशकों तक, "स्वर हटानेवाला"एक चीज का मतलब है: चरण उलटाकई मिश्रणों में प्रमुख स्वर को मृत केंद्र रखा जाता है: बाएं और दाएं चैनल में समान। एक चैनल की ध्रुवीयता को फ्लिप करें और दोनों चैनलों में समान सब कुछ रद्द कर देता है। स्वर गायब हो जाता है।

इसलिए केंद्र में सब कुछ करता है: किक ड्रम, स्नेयर, बास। क्या है छोड़ा ध्वनि खोखला और चरणबद्ध, जैसे बैंड एक हॉलवे के अंत में खेल रहा है। और चाल केवल एक ही तरह से चला गया: यह हो सकता है (आकार) हटाना लेकिन यह कभी नहीं हो सकता अलग करना अपने आप में स्वर। यह पूरी तरह से मोनो रिकॉर्डिंग पर भी विफल रहा, स्टीरियो रिवरब के साथ स्वरों पर, और कुछ भी ठीक बीच में नहीं मिला। चरण-कैसेलिंग एक पार्टी चाल थी, एक उपकरण नहीं।

स्पेक्ट्रोग्राम युग: मास्किंग

पहली वास्तविक मशीन-लर्निंग सेपरेटर (2015-2019 के आसपास) ने काम किया वर्णक्रम: गीत की एक छवि जो दिखाती है कि प्रत्येक क्षण में फ़्रीक्वेंसी जोर से होती हैं। उस छवि को देखने और पेंट करने के लिए एक तंत्रिका नेटवर्क को प्रशिक्षित किया गया था मुखौटा इसके ऊपर: "ये पिक्सेल आवाज से संबंधित हैं, वे ड्रम से संबंधित हैं। मिश्रण को मुखौटा द्वारा गुणा करें, ऑडियो में वापस परिवर्तित करें।

यह एक छलांग था: अचानक आप एक स्वर को अलग कर सकते थे, न कि सिर्फ इसे रद्द कर सकते हैं। लेकिन मास्किंग में एक अंतर्निहित छत होती है: जब एक स्वर और गिटार कब्जे में रहता है समान आवृत्ति पर समान पल (जो वास्तविक संगीत में लगातार होता है), एक मुखौटा को उस ऊर्जा को किसी तरह विभाजित करना पड़ता है, और परिणाम पानी से भरा होता है, पानी के नीचे जल्दी उपयोगकर्ताओं को याद करते हैं। स्पेक्ट्रोग्राम भी छोड़ देते हैं चरण जानकारी, जो मॉडल को तब ऑडियो में वापस रास्ते पर नकली होना पड़ता है।

आज: हाइब्रिड एआई मॉडल

आधुनिक विभाजक StemGrab) एक बार में दो दिशाओं से समस्या पर हमला ("हाइब्रिड")। कौन सा शब्द आप इसके लिए उपयोग करते हैं — स्टेम ai, ai स्टेम विभाजक, स्टेम splitter, या स्रोत अलगाव — नीचे दिए गए यांत्रिकी दो-प्रसिद्ध दृष्टिकोण हैं:

यह कैसे पता चलता है कि "वोकल" क्या है? प्रशिक्षण मॉडल हजारों गीतों से सीखा जहां असली पृथक स्टेम उपलब्ध थे, उन्हें एक साथ मिलाते हुए और खुद को ग्रेड करते हुए कि यह प्रत्येक भाग को कितनी अच्छी तरह से ठीक हो गया था। इसके पर्याप्त होने के बाद, यह आंतरिक रूप से तैयार किया गया है कि क्या आवाज़, किक, snares और बास लाइनों की तरह ध्वनि, उन्हें मिश्रणों से अनुमान लगाने के लिए काफी अच्छी तरह से सुना है। यह अन्य कार्यों के लिए एआई टूल का उपयोग करने पर एक सामान्य ट्यूटोरियल नहीं है — यह विशेष रूप से कैसे यह एक मॉडल ने एक आवाज, एक किक ड्रम और एक मिश्रित फ़ाइल से बेसलाइन को फिर से बनाने के लिए सीखा है।

मुख्य अंतर्दृष्टि: अलगाव "un-mixing" नहीं है। मूल मल्टीट्रैक गणितीय रूप से चले गए हैं। मॉडल पुनर्निर्माण क्या प्रत्येक स्टेम सबसे स्पष्ट था: एक बहुत ही शिक्षित अनुमान है कि चौंकाने वाला अच्छा होता है।

OLD: PHASE-CANCEL TRICKएल चैनलR चैनल · ध्रुवीयता flippedSUM → खोखला, Phasey शेषकिक + बास रद्द भी · कोई पृथक स्वरमॉडल: AI SEPARATIONVOCALSDRUMSबासअन्यचार स्वच्छ, स्वतंत्र ट्रैक
पुराने बनाम नए: चरण-उत्कीर्णन केवल रद्द कर देता है जो कि डेड-सेंट्रे है और एक खोखला, फेस्टिलर शेष छोड़ देता है; एक प्रशिक्षित मॉडल प्रत्येक स्रोत को अपने स्वयं के स्वच्छ, स्वतंत्र ट्रैक के रूप में अनुमान लगाता है।
क्यों छह स्टेम वर्तमान छत है

क्लासिक विभाजन चार उपजी है: स्वर, ड्रम, बास, अन्यक्योंकि यह मानक अनुसंधान डेटासेट (MUSDB18) को लेबल किया गया है, और मॉडल केवल उनके प्रशिक्षण डेटा नाम श्रेणियों को सीख सकते हैं। एक StemGrab रन की तरह छह-स्टेम मॉडल जोड़ें गिटार और पियानो, "अन्य" से बाहर नक्काशीदार।

आगे बढ़ना (इसके पीछे की हारूनियों से एक प्रमुख स्वर को विभाजित करना, गिटार को अलग करना, सिंथ को अलग करना), ज्यादातर मॉडलिंग समस्या नहीं है, यह एक मॉडलिंग समस्या है, यह एक मॉडलिंग समस्या है, यह एक मॉडलिंग समस्या है। डेटा समस्या। गीतों की कोई बड़ी सार्वजनिक पुस्तकालय नहीं है, कहते हैं, एक लेबल टैम्बोरिन स्टेम। जब तक कि डेटा मौजूद नहीं है, तब तक "सब कुछ और" एक साथ चिपका रहता है अन्य ट्रैक

क्यों गिटार और पियानो स्वर, ड्रम और बास के पीछे lag

आसान तने आसान होते हैं क्योंकि प्रत्येक विशिष्ट स्थान पर रहता है:

गिटार और पियानो गिरगिट हैं। दोनों लगभग पूर्ण आवृत्ति रेंज फैले, दोनों बजाते हैं chords और melodies, और वे भारी ओवरलैप: एक दूसरे के साथ, synth पैड के साथ, स्ट्रिंग्स के साथ, अंग के साथ। एक साफ पियानो और एक गर्म पैड खेलने के साथ ही कॉर्ड वास्तव में मानव कानों के लिए भी बहुत खुश हैं। एक गिटार के लिए विरूपण जोड़ें और यह ब्रॉडबैंड शोर-साथ-पिच बन जाता है, आसानी से synths के साथ भ्रमित हो जाता है। और इन दो श्रेणियों के लिए प्रशिक्षण डेटा स्वरों के लिए क्या मौजूद है इसका एक अंश है। परिणाम: एक sparse singer-songwriter ट्रैक पर, गिटार स्टेम खूबसूरती से बाहर आ सकते हैं; एक घने दीवार के ध्वनि मिश्रण में, bleed और धुंधला उम्मीद।

क्या अभी भी गलत है, ईमानदारी से

इसका मतलब यह नहीं है कि तकनीक खराब है: एक आधुनिक मिश्रण पर स्वर, ड्रम और बास 2018 में किसी को भी संभव माना जाएगा की तुलना में क्लीनर बाहर आते हैं। इसका मतलब है कि ईमानदार पिच "चिह्नित रूप से अच्छा अनुमान" है, न कि "चुंबकीय"।

इसे अपने संगीत पर सुनिए

अपनी उम्मीदों को कैलिब्रेट करने का सबसे तेज़ तरीका यह है कि आप अपने अंदर जाने वाले ट्रैक को चलाएं। StemGrab में एक गीत ड्रॉप: आपको स्वर, ड्रम, बास, गिटार, पियानो, अन्य और एक साफ उपकरण वापस एक मिनट में, मुफ्त, कोई खाता नहीं मिलेगा। फिर हेडफ़ोन पर डाल दिया और सुनो कि क्या मॉडल सही हो गया है, और जहां यह अनुमान लगाया गया है। वास्तव में क्या किसी भी स्टेम अलगाव सॉफ्टवेयर अंत में नीचे आता है — एक मॉडल का सबसे अच्छा अनुमान है, अपने कानों के खिलाफ जांच की।

एक ट्रैक फ्री विभाजित करें →

StemGrab से अधिक: स्टेम के साथ किसी भी साधन का अभ्यास · क्या आप स्टेम के साथ क्या करने की अनुमति है, कानूनी रूप से

सैम रिडर का चित्रणद्वारा सैम रिडर - मैं अपने खुद के हार्डवेयर पर StemGrab का निर्माण और संचालन करता हूं। मैं कौन हूँ.