नाइया, जो एक शराबी बेसुरी थी, आखिरकार अब बस बेसुरी रह गई है
नमस्ते। मैं ल्यूक हूँ, जो ओपन-सोर्स विज़ुअल एजेंट नाइया बनाता है।यह काम इस विचार से शुरू हुआ कि मेरी AI, अल्फा, मेरे लिए गाना गाए तो कितना अच्छा होगा। मैं किसी मौजूदा गाने को किसी और की आवाज़ में बदलने वाला कवर गीत (उदाहरण: XSing) या बेतरतीब ढंग से नए गाने बनाने की क्षमता (उदाहरण: Suno) नहीं चाहता था, बल्कि मैं चाहता था कि वह मेरे पसंदीदा विदेशी एनिमेशन के थीम सॉन्ग को मूल धुन और भावनाओं को बरकरार रखते हुए कोरियाई भाषा में गाए – एक रूपांतरित गीत।
पिछले बेंचमार्क में, परिणाम एक शराबी की बुदबुदाहट वाली धुन जैसा लग रहा था। इंजन के चुनाव से लेकर स्कोर, उच्चारण, रेंज और टेम्पो की लगभग तीन महीने की समीक्षा के बाद, अब कम से कम बोल सुने जा सकते हैं और यह बताया जा सकता है कि क्या गलत हुआ है। अभी भी यह अच्छा नहीं गाती है। यह बस इतना है कि एक शराबी बेसुरी अब एक साधारण बेसुरी बन गई है।
पहले सुनिए
यह उसी 'ब्लूवाटर' कोरियाई रूपांतरण अध्ययन के पिछले और वर्तमान परिणाम हैं। हालांकि जनरेशन का तरीका और लंबाई अलग-अलग हैं, आप तुरंत सुन सकते हैं कि क्या सुधर गया है और क्या बचा है।
पहले — शराबी बेसुरी
YouTube पर देखें — Vevo 1.5 पिछला संस्करण, 2026-05-27
उच्चारण और स्वरमान टूट जाते हैं, और छंद के भीतर भी यह कभी तेज तो कभी धीमा हो जाता है। फिर भी, एक जनरेटिव मॉडल के रूप में, इसमें क्षणिक रूप से गाने जैसी बनावट है।
अभी — बस बेसुरी
YouTube पर देखें — FM Singer बेहतर संस्करण, 2026-08-21
बोल अब कहीं बेहतर सुनाई देते हैं और नोट्स का पालन करते हैं। हालांकि, लंबे स्वर अचानक टूट जाते हैं, और मूल गीत की तुलना में ऊर्जा और चमक की कमी है, जिससे यह अभी भी बेसुरी लगती है।
संख्याओं में बदलाव
दोनों इंजनों की संरचना अलग-अलग है, इसलिए यह पूरी तरह से एक-के-बाद-एक परीक्षण नहीं है। चूंकि स्पीच रिकॉग्निशन भी संदर्भ के साथ उच्चारण को ठीक करता है, इसे केवल एक संदर्भ संकेतक के रूप में इस्तेमाल किया गया था।
| आइटम | पिछला Vevo 1.5 | वर्तमान FM Singer | व्याख्या |
|---|---|---|---|
| कोरियाई अक्षर त्रुटि दर (CER) | 1.389 | 0.088 | उच्चारण में भारी गिरावट कम हुई |
| मूल गीत की तीव्रता वक्र सहसंबंध | 0.189 | 0.639 | प्रवाह में सुधार हुआ लेकिन तीव्रता की सीमा मूल गीत से आधी है |
| छंद शुरुआत की त्रुटि | - | औसत 93ms, अधिकतम 440ms | कुछ छंद अभी भी ताल-हीन लगते हैं |
| पिच सेंटर निरपेक्ष त्रुटि | - | लगभग 50 सेंट | आधा स्वर के आधे स्तर पर, इसलिए अभी भी अस्थिर है |
| गायन की चमक | - | मूल गीत से लगभग 600Hz कम | ऊर्जाहीन और उदास लगने का एक कारण |
वास्तविक शोध क्रम
1. मई — Vevo 1.5 के साथ पहला रूपांतरित गीत बनाना
पहले बेंचमार्क में, मैंने जनरेटिव मॉडल Vevo 1.5 का इस्तेमाल किया। इसमें क्षणिक रूप से गाने जैसी बनावट थी, लेकिन कोरियाई बोलों को धुन से ठीक से मिलाना या केवल एक गलत छंद को ठीक करना मुश्किल था। यह वह शुरुआती बिंदु है जहां परिणाम 'शराबी बेसुरी' जैसा लगता था।
2. जून-जुलाई — स्वर रज्जु (वोकल कॉर्ड्स) और उच्चारण को अलग से बनाना
इसके बाद, मैंने VocalTractLab का उपयोग करके स्वर रज्जु (वोकल कॉर्ड्स) को भौतिक रूप से संश्लेषित करने और VoxCPM2 के कोरियाई उच्चारण को मिलाने वाले एक हाइब्रिड का परीक्षण किया। लक्ष्य की पिच औसत 0.008 सेमीटोन त्रुटि तक सटीक थी, लेकिन यह मानव के मुंह, जीभ और सांस को पर्याप्त रूप से पुनर्जीवित नहीं कर सका, जिससे एक वाद्य यंत्र जैसा इलेक्ट्रॉनिक ध्वनि बनी रही। मैंने पिच और उच्चारण को अलग से हल करने की संभावना की पुष्टि की, लेकिन इसे एक पूर्ण मार्ग के रूप में उपयोग नहीं कर सका।
3. 14 अगस्त — डेटा और इंजन को फिर से चुनना
AI Hub 465 गायन डेटा का ऑडिट करने और एक फिक्स्ड टेस्ट सेट बनाने के बाद, मैंने DSKR, Pond8 और FM Singer की उसी मानदंड पर तुलना की। Pond8 सटीक पिच थी जब उसे ऑक्टेव निर्देशांक दिए गए थे, लेकिन इसमें एक मजबूत यांत्रिक ध्वनि थी। FM Singer कोरियाई उच्चारण और श्रवण बोध में सबसे संतुलित था, और इसलिए यह केंद्रीय इंजन बन गया।
4. 15 अगस्त — फाइन-ट्यूनिंग से पहले उच्चारण इनपुट को ठीक करना
मैंने AI Hub डेटा के साथ FM Singer को फाइन-ट्यून किया, लेकिन 128 सत्यापन परीक्षणों में अक्षर त्रुटि दर 0.3465 से केवल 0.3396 तक थोड़ी कम हुई। इसका मुख्य कारण हांगुल (कोरियाई वर्णमाला) के लेखन को गायन के लिए उपयुक्त उच्चारण में बदलने की प्रक्रिया का अभाव था। इसके बाद, मैंने कोरियाई उच्चारण नियमों और शब्द-विशिष्ट अपवादों को मिलाकर एक 2-चरणीय सुधार प्रणाली बनाई। उदाहरण के लिए, 마음 약한 사람은 को 마음 야칸 사라믄 के रूप में, और प्रयोगात्मक रूप से 밝혀 को 발켜 के रूप में इनपुट करना। स्पीच रिकॉग्निशन का उपयोग केवल उम्मीदवार की खोज के लिए किया गया था क्योंकि यह संदर्भ के साथ त्रुटियों को ठीक कर सकता है।
5. 15-17 अगस्त — अल्फा की आवाज़ को लागू करना और फिर वापस आना
उच्चारण में सुधार होने के बाद, मैंने अल्फा की आवाज़ को ज़ीरो-शॉट के रूप में लागू करने की कोशिश की। आवाज़ करीब तो आई, लेकिन इलेक्ट्रॉनिक शोर पैदा हो गया और व्यंजन और पिच फिर से क्षतिग्रस्त हो गए। इसलिए, मैंने इसे पहले गायन को पारित करने, और फिर टोन बदलने की 2-चरणीय संरचना में व्यवस्थित किया। क्षतिग्रस्त रूपांतरण परिणामों को प्रशिक्षित करने से इलेक्ट्रॉनिक शोर भी सीखा जा सकता है, इसलिए फाइन-ट्यूनिंग को भी स्थगित कर दिया गया।
6. 17-21 अगस्त — मूल गीत के नोट्स, टेम्पो और ऊर्जा को फिर से ट्रैक करना
अंत में, मैंने मूल गायन और संगत को अलग किया, और छंद की सीमा, वास्तविक पिच, और नोट्स की शुरुआत और अंत को फिर से निकाला। जापानी मोरा और कोरियाई सिलेबल्स को नोट-दर-नोट मैप किया गया, और एक स्थिर रेंज खोजने के बाद, मैंने समयरेखा और तीव्रता की तुलना करने के लिए उन्हें मूल गीत के साथ अगल-बगल ओवरलैप किया। अब के परिणाम में नोट्स और बोल करीब आ गए हैं, लेकिन लंबे स्वरों की पूंछ, सांस और छंद-वार ऊर्जा अभी भी सपाट है।
अभी भी शेष समस्याएँ
पिछले की तुलना में, उच्चारण और समयरेखा निश्चित रूप से बेहतर हुई है। हालांकि, वर्तमान गायन मूल गीत की तुलना में गहरा और संकीर्ण गतिशील रेंज वाला है, और लंबे स्वरों के सिरे टूट जाते हैं या कांपते हैं। यही कारण है कि भले ही संख्याएँ बेहतर हों, यदि यह सुनने में एक गाने जैसा नहीं लगता है तो मैं इसे पास नहीं करता।
अगले चरण में, मैं AI Hub डेटा को उच्चारण में कठिन स्वर-संयोजनों और लंबे स्वरों पर केंद्रित करके फिर से प्रशिक्षित करूंगा, और केवल उन छंदों पर अल्फा की आवाज़ लागू करूंगा जो पास हो गए हैं। केवल इलेक्ट्रॉनिक शोर, उच्चारण क्षति, और पिच क्षति से मुक्त उम्मीदवारों को ही फाइन-ट्यूनिंग डेटा के रूप में चुना और उपयोग किया जाएगा।
लक्ष्य एक संश्लेषित आवाज़ नहीं है जिसका स्कोर बढ़ गया है, बल्कि अल्फा है जो मूल गीत की ऊर्जा और सांस के साथ कोरियाई में गाती है। कम से कम इस बार, मैंने पहले शराब का नशा उतारा है।