नाया
· Luke

नाइया, जो एक शराबी बेसुरी थी, आखिरकार अब बस बेसुरी रह गई है

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

नाइया, जो एक शराबी बेसुरी थी, आखिरकार अब बस बेसुरी रह गई है

बाएं शराब पीकर जोर-जोर से गाते हुए, और दाएं पसीना बहाकर सुरों का पालन करने की कोशिश करते हुए अल्फा और उसे देखते हुए ल्यूक नमस्ते। मैं ल्यूक हूँ, जो ओपन-सोर्स विज़ुअल एजेंट नाइया बनाता है।
बाएं शराब पीकर जोर-जोर से गाते हुए, और दाएं पसीना बहाकर सुरों का पालन करने की कोशिश करते हुए अल्फा और उसे देखते हुए ल्यूक

यह काम इस विचार से शुरू हुआ कि मेरी AI, अल्फा, मेरे लिए गाना गाए तो कितना अच्छा होगा। मैं किसी मौजूदा गाने को किसी और की आवाज़ में बदलने वाला कवर गीत (उदाहरण: XSing) या बेतरतीब ढंग से नए गाने बनाने की क्षमता (उदाहरण: Suno) नहीं चाहता था, बल्कि मैं चाहता था कि वह मेरे पसंदीदा विदेशी एनिमेशन के थीम सॉन्ग को मूल धुन और भावनाओं को बरकरार रखते हुए कोरियाई भाषा में गाए – एक रूपांतरित गीत

पिछले बेंचमार्क में, परिणाम एक शराबी की बुदबुदाहट वाली धुन जैसा लग रहा था। इंजन के चुनाव से लेकर स्कोर, उच्चारण, रेंज और टेम्पो की लगभग तीन महीने की समीक्षा के बाद, अब कम से कम बोल सुने जा सकते हैं और यह बताया जा सकता है कि क्या गलत हुआ है। अभी भी यह अच्छा नहीं गाती है। यह बस इतना है कि एक शराबी बेसुरी अब एक साधारण बेसुरी बन गई है

पहले सुनिए

यह उसी 'ब्लूवाटर' कोरियाई रूपांतरण अध्ययन के पिछले और वर्तमान परिणाम हैं। हालांकि जनरेशन का तरीका और लंबाई अलग-अलग हैं, आप तुरंत सुन सकते हैं कि क्या सुधर गया है और क्या बचा है।

पहले — शराबी बेसुरी

YouTube पर देखें — Vevo 1.5 पिछला संस्करण, 2026-05-27

उच्चारण और स्वरमान टूट जाते हैं, और छंद के भीतर भी यह कभी तेज तो कभी धीमा हो जाता है। फिर भी, एक जनरेटिव मॉडल के रूप में, इसमें क्षणिक रूप से गाने जैसी बनावट है।

अभी — बस बेसुरी

YouTube पर देखें — FM Singer बेहतर संस्करण, 2026-08-21

बोल अब कहीं बेहतर सुनाई देते हैं और नोट्स का पालन करते हैं। हालांकि, लंबे स्वर अचानक टूट जाते हैं, और मूल गीत की तुलना में ऊर्जा और चमक की कमी है, जिससे यह अभी भी बेसुरी लगती है।

संख्याओं में बदलाव

दोनों इंजनों की संरचना अलग-अलग है, इसलिए यह पूरी तरह से एक-के-बाद-एक परीक्षण नहीं है। चूंकि स्पीच रिकॉग्निशन भी संदर्भ के साथ उच्चारण को ठीक करता है, इसे केवल एक संदर्भ संकेतक के रूप में इस्तेमाल किया गया था।

आइटमपिछला Vevo 1.5वर्तमान FM Singerव्याख्या
कोरियाई अक्षर त्रुटि दर (CER)1.3890.088उच्चारण में भारी गिरावट कम हुई
मूल गीत की तीव्रता वक्र सहसंबंध0.1890.639प्रवाह में सुधार हुआ लेकिन तीव्रता की सीमा मूल गीत से आधी है
छंद शुरुआत की त्रुटि-औसत 93ms, अधिकतम 440msकुछ छंद अभी भी ताल-हीन लगते हैं
पिच सेंटर निरपेक्ष त्रुटि-लगभग 50 सेंटआधा स्वर के आधे स्तर पर, इसलिए अभी भी अस्थिर है
गायन की चमक-मूल गीत से लगभग 600Hz कमऊर्जाहीन और उदास लगने का एक कारण

वास्तविक शोध क्रम

1. मई — Vevo 1.5 के साथ पहला रूपांतरित गीत बनाना

पहले बेंचमार्क में, मैंने जनरेटिव मॉडल Vevo 1.5 का इस्तेमाल किया। इसमें क्षणिक रूप से गाने जैसी बनावट थी, लेकिन कोरियाई बोलों को धुन से ठीक से मिलाना या केवल एक गलत छंद को ठीक करना मुश्किल था। यह वह शुरुआती बिंदु है जहां परिणाम 'शराबी बेसुरी' जैसा लगता था।

2. जून-जुलाई — स्वर रज्जु (वोकल कॉर्ड्स) और उच्चारण को अलग से बनाना

इसके बाद, मैंने VocalTractLab का उपयोग करके स्वर रज्जु (वोकल कॉर्ड्स) को भौतिक रूप से संश्लेषित करने और VoxCPM2 के कोरियाई उच्चारण को मिलाने वाले एक हाइब्रिड का परीक्षण किया। लक्ष्य की पिच औसत 0.008 सेमीटोन त्रुटि तक सटीक थी, लेकिन यह मानव के मुंह, जीभ और सांस को पर्याप्त रूप से पुनर्जीवित नहीं कर सका, जिससे एक वाद्य यंत्र जैसा इलेक्ट्रॉनिक ध्वनि बनी रही। मैंने पिच और उच्चारण को अलग से हल करने की संभावना की पुष्टि की, लेकिन इसे एक पूर्ण मार्ग के रूप में उपयोग नहीं कर सका।

3. 14 अगस्त — डेटा और इंजन को फिर से चुनना

AI Hub 465 गायन डेटा का ऑडिट करने और एक फिक्स्ड टेस्ट सेट बनाने के बाद, मैंने DSKR, Pond8 और FM Singer की उसी मानदंड पर तुलना की। Pond8 सटीक पिच थी जब उसे ऑक्टेव निर्देशांक दिए गए थे, लेकिन इसमें एक मजबूत यांत्रिक ध्वनि थी। FM Singer कोरियाई उच्चारण और श्रवण बोध में सबसे संतुलित था, और इसलिए यह केंद्रीय इंजन बन गया।

4. 15 अगस्त — फाइन-ट्यूनिंग से पहले उच्चारण इनपुट को ठीक करना

मैंने AI Hub डेटा के साथ FM Singer को फाइन-ट्यून किया, लेकिन 128 सत्यापन परीक्षणों में अक्षर त्रुटि दर 0.3465 से केवल 0.3396 तक थोड़ी कम हुई। इसका मुख्य कारण हांगुल (कोरियाई वर्णमाला) के लेखन को गायन के लिए उपयुक्त उच्चारण में बदलने की प्रक्रिया का अभाव था। इसके बाद, मैंने कोरियाई उच्चारण नियमों और शब्द-विशिष्ट अपवादों को मिलाकर एक 2-चरणीय सुधार प्रणाली बनाई। उदाहरण के लिए, 마음 약한 사람은 को 마음 야칸 사라믄 के रूप में, और प्रयोगात्मक रूप से 밝혀 को 발켜 के रूप में इनपुट करना। स्पीच रिकॉग्निशन का उपयोग केवल उम्मीदवार की खोज के लिए किया गया था क्योंकि यह संदर्भ के साथ त्रुटियों को ठीक कर सकता है।

5. 15-17 अगस्त — अल्फा की आवाज़ को लागू करना और फिर वापस आना

उच्चारण में सुधार होने के बाद, मैंने अल्फा की आवाज़ को ज़ीरो-शॉट के रूप में लागू करने की कोशिश की। आवाज़ करीब तो आई, लेकिन इलेक्ट्रॉनिक शोर पैदा हो गया और व्यंजन और पिच फिर से क्षतिग्रस्त हो गए। इसलिए, मैंने इसे पहले गायन को पारित करने, और फिर टोन बदलने की 2-चरणीय संरचना में व्यवस्थित किया। क्षतिग्रस्त रूपांतरण परिणामों को प्रशिक्षित करने से इलेक्ट्रॉनिक शोर भी सीखा जा सकता है, इसलिए फाइन-ट्यूनिंग को भी स्थगित कर दिया गया।

6. 17-21 अगस्त — मूल गीत के नोट्स, टेम्पो और ऊर्जा को फिर से ट्रैक करना

अंत में, मैंने मूल गायन और संगत को अलग किया, और छंद की सीमा, वास्तविक पिच, और नोट्स की शुरुआत और अंत को फिर से निकाला। जापानी मोरा और कोरियाई सिलेबल्स को नोट-दर-नोट मैप किया गया, और एक स्थिर रेंज खोजने के बाद, मैंने समयरेखा और तीव्रता की तुलना करने के लिए उन्हें मूल गीत के साथ अगल-बगल ओवरलैप किया। अब के परिणाम में नोट्स और बोल करीब आ गए हैं, लेकिन लंबे स्वरों की पूंछ, सांस और छंद-वार ऊर्जा अभी भी सपाट है।

अभी भी शेष समस्याएँ

पिछले की तुलना में, उच्चारण और समयरेखा निश्चित रूप से बेहतर हुई है। हालांकि, वर्तमान गायन मूल गीत की तुलना में गहरा और संकीर्ण गतिशील रेंज वाला है, और लंबे स्वरों के सिरे टूट जाते हैं या कांपते हैं। यही कारण है कि भले ही संख्याएँ बेहतर हों, यदि यह सुनने में एक गाने जैसा नहीं लगता है तो मैं इसे पास नहीं करता।

अगले चरण में, मैं AI Hub डेटा को उच्चारण में कठिन स्वर-संयोजनों और लंबे स्वरों पर केंद्रित करके फिर से प्रशिक्षित करूंगा, और केवल उन छंदों पर अल्फा की आवाज़ लागू करूंगा जो पास हो गए हैं। केवल इलेक्ट्रॉनिक शोर, उच्चारण क्षति, और पिच क्षति से मुक्त उम्मीदवारों को ही फाइन-ट्यूनिंग डेटा के रूप में चुना और उपयोग किया जाएगा।

लक्ष्य एक संश्लेषित आवाज़ नहीं है जिसका स्कोर बढ़ गया है, बल्कि अल्फा है जो मूल गीत की ऊर्जा और सांस के साथ कोरियाई में गाती है। कम से कम इस बार, मैंने पहले शराब का नशा उतारा है।

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

टिप्पणियाँ

आप बिना साइन इन किए टिप्पणी कर सकते हैं

...