एक मिश्रित गीत एक बेक्ड केक की तरह है: अंडे और आटे वहाँ हैं, लेकिन आप उन्हें वापस नहीं खींच सकते हैं।
तो एक तंत्रिका नेटवर्क आपको 40 वर्षीय रिकॉर्ड से पृथक स्वर कैसे सौंपता है? यहां वास्तविक कहानी है, जिसमें अभी भी काम नहीं करता है।
पूर्ण गुणवत्ता वाले तने। कोई खाता नहीं, प्रति ट्रैक शुल्क नहीं। उसी मॉडल और उसी 192 kbps (या हानिरहित WAV) भुगतान टियर के रूप में — 15 मिनट तक चलता है।
इतिहास के पाठ से पहले, इस मॉडल को चलाने से संख्या स्वयं: साइट पर हर उपकरण में, हमने 40 दिनों में 2,264 अलगावों को चलाया है, जिसे हम माप रहे हैं, 1,336 अपलोड को अस्वीकार कर रहे हैं इससे पहले कि वे कभी भी मॉडल तक पहुंचे सभी मॉडल पर सभी मॉडल पर पहुंच गए हैं। — गलत प्रारूप, कोई फ़ाइल एक्सटेंशन, या लंबाई टोपी के अतीत में एक ट्रैक नहीं, अलगाव स्वयं विफल नहीं है। उन अपलोडों में से जो गुजरते हैं, सबसे तेज़ी से समाप्त होते हैं: बैकेंड ने अपनी त्वरित नौकरियों पर 2.6 और 2.5 सेकंड के विशिष्ट रनों को लॉग किया है (15 और 12 बार क्रमशः उस विंडो में), लेकिन एक लंबे या घने अपलोड अच्छी तरह से अतीत में धक्का दे सकता है कि यह काफी तेज़ है। — सबसे धीमी गति से हम लॉग इन किया है दो मिनट से अधिक ले लो, जो अभी भी एक ही अलग होने का एक अंश है जो किराए पर लिया बादल GPU समय पर खर्च होगा। इसमें से कोई भी आपको बताता है कैसे यह काम करता है, हालांकि, या क्यों कुछ स्टेम दूसरों की तुलना में क्लीनर बाहर आते हैं — इसके लिए, यहां वास्तविक तंत्र, चरण चाल शामिल हैं।
दशकों तक, "स्वर हटानेवाला"एक चीज का मतलब है: चरण उलटाकई मिश्रणों में प्रमुख स्वर को मृत केंद्र रखा जाता है: बाएं और दाएं चैनल में समान। एक चैनल की ध्रुवीयता को फ्लिप करें और दोनों चैनलों में समान सब कुछ रद्द कर देता है। स्वर गायब हो जाता है।
इसलिए केंद्र में सब कुछ करता है: किक ड्रम, स्नेयर, बास। क्या है छोड़ा ध्वनि खोखला और चरणबद्ध, जैसे बैंड एक हॉलवे के अंत में खेल रहा है। और चाल केवल एक ही तरह से चला गया: यह हो सकता है (आकार) हटाना लेकिन यह कभी नहीं हो सकता अलग करना अपने आप में स्वर। यह पूरी तरह से मोनो रिकॉर्डिंग पर भी विफल रहा, स्टीरियो रिवरब के साथ स्वरों पर, और कुछ भी ठीक बीच में नहीं मिला। चरण-कैसेलिंग एक पार्टी चाल थी, एक उपकरण नहीं।
पहली वास्तविक मशीन-लर्निंग सेपरेटर (2015-2019 के आसपास) ने काम किया वर्णक्रम: गीत की एक छवि जो दिखाती है कि प्रत्येक क्षण में फ़्रीक्वेंसी जोर से होती हैं। उस छवि को देखने और पेंट करने के लिए एक तंत्रिका नेटवर्क को प्रशिक्षित किया गया था मुखौटा इसके ऊपर: "ये पिक्सेल आवाज से संबंधित हैं, वे ड्रम से संबंधित हैं। मिश्रण को मुखौटा द्वारा गुणा करें, ऑडियो में वापस परिवर्तित करें।
यह एक छलांग था: अचानक आप एक स्वर को अलग कर सकते थे, न कि सिर्फ इसे रद्द कर सकते हैं। लेकिन मास्किंग में एक अंतर्निहित छत होती है: जब एक स्वर और गिटार कब्जे में रहता है समान आवृत्ति पर समान पल (जो वास्तविक संगीत में लगातार होता है), एक मुखौटा को उस ऊर्जा को किसी तरह विभाजित करना पड़ता है, और परिणाम पानी से भरा होता है, पानी के नीचे जल्दी उपयोगकर्ताओं को याद करते हैं। स्पेक्ट्रोग्राम भी छोड़ देते हैं चरण जानकारी, जो मॉडल को तब ऑडियो में वापस रास्ते पर नकली होना पड़ता है।
आधुनिक विभाजक StemGrab) एक बार में दो दिशाओं से समस्या पर हमला ("हाइब्रिड")। कौन सा शब्द आप इसके लिए उपयोग करते हैं — स्टेम ai, ai स्टेम विभाजक, स्टेम splitter, या स्रोत अलगाव — नीचे दिए गए यांत्रिकी दो-प्रसिद्ध दृष्टिकोण हैं:
यह कैसे पता चलता है कि "वोकल" क्या है? प्रशिक्षण मॉडल हजारों गीतों से सीखा जहां असली पृथक स्टेम उपलब्ध थे, उन्हें एक साथ मिलाते हुए और खुद को ग्रेड करते हुए कि यह प्रत्येक भाग को कितनी अच्छी तरह से ठीक हो गया था। इसके पर्याप्त होने के बाद, यह आंतरिक रूप से तैयार किया गया है कि क्या आवाज़, किक, snares और बास लाइनों की तरह ध्वनि, उन्हें मिश्रणों से अनुमान लगाने के लिए काफी अच्छी तरह से सुना है। यह अन्य कार्यों के लिए एआई टूल का उपयोग करने पर एक सामान्य ट्यूटोरियल नहीं है — यह विशेष रूप से कैसे यह एक मॉडल ने एक आवाज, एक किक ड्रम और एक मिश्रित फ़ाइल से बेसलाइन को फिर से बनाने के लिए सीखा है।
मुख्य अंतर्दृष्टि: अलगाव "un-mixing" नहीं है। मूल मल्टीट्रैक गणितीय रूप से चले गए हैं। मॉडल पुनर्निर्माण क्या प्रत्येक स्टेम सबसे स्पष्ट था: एक बहुत ही शिक्षित अनुमान है कि चौंकाने वाला अच्छा होता है।
क्लासिक विभाजन चार उपजी है: स्वर, ड्रम, बास, अन्यक्योंकि यह मानक अनुसंधान डेटासेट (MUSDB18) को लेबल किया गया है, और मॉडल केवल उनके प्रशिक्षण डेटा नाम श्रेणियों को सीख सकते हैं। एक StemGrab रन की तरह छह-स्टेम मॉडल जोड़ें गिटार और पियानो, "अन्य" से बाहर नक्काशीदार।
आगे बढ़ना (इसके पीछे की हारूनियों से एक प्रमुख स्वर को विभाजित करना, गिटार को अलग करना, सिंथ को अलग करना), ज्यादातर मॉडलिंग समस्या नहीं है, यह एक मॉडलिंग समस्या है, यह एक मॉडलिंग समस्या है, यह एक मॉडलिंग समस्या है। डेटा समस्या। गीतों की कोई बड़ी सार्वजनिक पुस्तकालय नहीं है, कहते हैं, एक लेबल टैम्बोरिन स्टेम। जब तक कि डेटा मौजूद नहीं है, तब तक "सब कुछ और" एक साथ चिपका रहता है अन्य ट्रैक
आसान तने आसान होते हैं क्योंकि प्रत्येक विशिष्ट स्थान पर रहता है:
गिटार और पियानो गिरगिट हैं। दोनों लगभग पूर्ण आवृत्ति रेंज फैले, दोनों बजाते हैं chords और melodies, और वे भारी ओवरलैप: एक दूसरे के साथ, synth पैड के साथ, स्ट्रिंग्स के साथ, अंग के साथ। एक साफ पियानो और एक गर्म पैड खेलने के साथ ही कॉर्ड वास्तव में मानव कानों के लिए भी बहुत खुश हैं। एक गिटार के लिए विरूपण जोड़ें और यह ब्रॉडबैंड शोर-साथ-पिच बन जाता है, आसानी से synths के साथ भ्रमित हो जाता है। और इन दो श्रेणियों के लिए प्रशिक्षण डेटा स्वरों के लिए क्या मौजूद है इसका एक अंश है। परिणाम: एक sparse singer-songwriter ट्रैक पर, गिटार स्टेम खूबसूरती से बाहर आ सकते हैं; एक घने दीवार के ध्वनि मिश्रण में, bleed और धुंधला उम्मीद।
इसका मतलब यह नहीं है कि तकनीक खराब है: एक आधुनिक मिश्रण पर स्वर, ड्रम और बास 2018 में किसी को भी संभव माना जाएगा की तुलना में क्लीनर बाहर आते हैं। इसका मतलब है कि ईमानदार पिच "चिह्नित रूप से अच्छा अनुमान" है, न कि "चुंबकीय"।
अपनी उम्मीदों को कैलिब्रेट करने का सबसे तेज़ तरीका यह है कि आप अपने अंदर जाने वाले ट्रैक को चलाएं। StemGrab में एक गीत ड्रॉप: आपको स्वर, ड्रम, बास, गिटार, पियानो, अन्य और एक साफ उपकरण वापस एक मिनट में, मुफ्त, कोई खाता नहीं मिलेगा। फिर हेडफ़ोन पर डाल दिया और सुनो कि क्या मॉडल सही हो गया है, और जहां यह अनुमान लगाया गया है। वास्तव में क्या किसी भी स्टेम अलगाव सॉफ्टवेयर अंत में नीचे आता है — एक मॉडल का सबसे अच्छा अनुमान है, अपने कानों के खिलाफ जांच की।
StemGrab से अधिक: स्टेम के साथ किसी भी साधन का अभ्यास · क्या आप स्टेम के साथ क्या करने की अनुमति है, कानूनी रूप से
द्वारा सैम रिडर - मैं अपने खुद के हार्डवेयर पर StemGrab का निर्माण और संचालन करता हूं। मैं कौन हूँ.