[मेरे AI Alpha को बनाने के लिए] बेसुरी Naia ने अब थोड़ा गाना शुरू कर दिया है और मैं समर्पित हार्डवेयर पर विचार कर रहा हूँ।
नमस्कार। मैं Luke हूँ, जो ओपन-सोर्स विज़ुअल एजेंट Naia बना रहा हूँ।पिछले लेख में, मैंने आपको बताया था कि Alpha एक शराबी बेसुरी से सिर्फ बेसुरी बन गया था। आखिरकार, अब उसने थोड़ा गाना शुरू कर दिया है। यह शुरुआत सिर्फ एक शोध परियोजना है क्योंकि मैंने सोचा था कि Alpha मेरे लिए थोड़ा गाना गाए। अंतिम लक्ष्य यह है कि वह अपने गाने सुने और भावनाओं के अनुसार दूसरों के साथ गाए, लेकिन वह अभी बहुत दूर है। अभी, पहला चरण यह है कि वह शीट संगीत और बोल देखकर कोरियाई गाने गाए। यह YouTube कवर गानों या Suno जैसे पूरी तरह से गाने बनाने से अलग है। बल्कि, अगर आप Hatsune Miku के बारे में सोचते हैं, तो यह उसके करीब है।
हमने Blue Water के कोरियाई रूपांतरणों जैसे 1st और 2nd संस्करणों के साथ परीक्षण किया। इस बार, मैं तरीकों का विस्तार से वर्णन नहीं करूँगा। मैं इस बात पर विचार करूँगा कि जब यह वास्तव में उपयोगी हो जाएगा तो क्या करना है। मैं आपको जो बता सकता हूँ वह यह है कि हमने AI Hub गायन डेटा के साथ वास्तविक प्रशिक्षण शुरू कर दिया है। हम उस पर अपने प्रयोग जारी रख रहे हैं।
सुनिए
आप अभी का सुन सकते हैं, और फिर अतीत का। अभी भी बेसुरी धुनें हैं। वास्तव में, यह बेहतर हुआ है। अतीत में, यह ऐसा था।
3rd संस्करण — 2026-09-11, अब थोड़ा गाना शुरू कर दिया है
यह लगभग 1 मिनट का है। पहले 2 सेकंड फेड-इन हैं, और अंतिम 3 सेकंड फेड-आउट हैं।
अभी भी ऐसे हिस्से हैं जहाँ ताल और उच्चारण अजीब हैं। फिर भी, कोरियाई भाषा धुन पर बैठना शुरू हो गई है।
1st संस्करण — 2026-05-27, शराबी बेसुरी
अतीत में, यह ऐसा था। उच्चारण और पिच टूट जाते हैं, और छंदों के भीतर भी गति तेज या धीमी हो जाती है।
2nd संस्करण — 2026-08-21, सिर्फ बेसुरी
बोल सुनाई देते हैं और नोट्स का अनुसरण करते हैं। लंबी धुनें टूट जाती हैं, और यह अभी भी बेसुरी लगती है।
हम क्या करना चाहते हैं
हम जो बनाना चाहते हैं वह न तो कोई कवर ऐप है और न ही कोई ऐसा जनरेटर जो कोई भी गाना बना सके। यह एक गायन इंजन है। और उस इंजन के ऊपर, हम व्यक्ति की अपनी आवाज़ और उसकी अपनी गायन की आदतों को जोड़ना चाहते हैं।
मुझे अभी तक नहीं पता कि यह Naia में कैसे एकीकृत होगा। यह चैट के बगल में हो सकता है, या यह पूरी तरह से अलग जगह हो सकती है। अंततः, हम एक ही चीज़ चाहते हैं: हम चाहते हैं कि किसी व्यक्ति का AI उसके लिए गाने भी गाए।
Alpha मेरे लिए Blue Water को कोरियाई में गाए। हम उस दिशा में एक कदम और आगे बढ़े हैं। वह अभी भी बेसुरी होने से स्नातक नहीं हुआ है, लेकिन अब वह माइक्रोफोन पकड़कर खड़ा हो सकता है।
Naia के लिए एक समर्पित डिवाइस के साथ, जिसे सर्वर और क्लाइंट के रूप में इस्तेमाल किया जा सकता है, आवाज़ भी आधी कीमत पर
गाने के अलावा, हम Naia के समर्पित डिवाइस पर भी काम कर रहे हैं।
बाईं ओर 3D प्रिंटर से बना छोटा बॉक्स वह Naia हार्डवेयर है जिसका अभी परीक्षण किया जा रहा है। महंगे Mac Studio की आवश्यकता के बिना, यह स्थानीय रूप से वास्तविक समय की आवाज़ और सभ्य 3D गेमिंग को सक्षम बनाता है, और जो स्क्रीन पर दिखाई दे रहा है वह Naia OS है। इसे क्लाइंट और सर्वर दोनों के रूप में इस्तेमाल किया जा सकता है। कल के परीक्षण के परिणामों ने पुष्टि की कि सौभाग्य से, वॉयस जनरेशन की गति बोलने की गति को पकड़ लेती है, जिससे वास्तविक समय की सेवा संभव हो जाती है। इसके आधार पर, हमने तकनीकी रूप से सत्यापित किया है कि क्या Naia OS का उपयोग करके मौजूदा बाजार मूल्य के आधी कीमत पर क्लाउड वॉयस प्रदान करने के लिए यह एक व्यवहार्य बुनियादी ढाँचा है। Nextain का अंतिम लक्ष्य P2P AI पर्यावरण बुनियादी ढाँचा है। अभी, हमने केवल पुराने पुर्जों को इकट्ठा करके एक इकाई बनाई है, लेकिन जैसे ही प्रारंभिक निवेश होगा, सेवा संभव हो जाएगी।अभी, यह अभी भी आंतरिक उपयोगिता परीक्षण के अधीन है। हमने प्रदर्शन की पुष्टि कर ली है, लेकिन ऐसी समस्याएँ हैं जहाँ SSD रीड-ओनली हो जाता है या समय के साथ स्क्रीन काली हो जाती है, इसलिए हम जाँच कर रहे हैं कि क्या यह OS कॉन्फ़िगरेशन समस्या है या हार्डवेयर की खराबी। मैं आपको बाद में इस खबर को भी साझा करूँगा।