نايا
· Luke

نايا، التي كانت نشازًا مخمورًا، أصبحت أخيرًا مجرد نشاز

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

نايا، التي كانت نشازًا مخمورًا، أصبحت أخيرًا مجرد نشاز

على اليسار، ألفا تغني بصوت عالٍ وهي مخمورة، وعلى اليمين، تتدرب على تتبع النغمات بينما يراقبها لوك مرحبًا بكم. أنا لوك، مطور العميلة البصرية مفتوحة المصدر نايا.
على اليسار، ألفا تغني بصوت عالٍ وهي مخمورة، وعلى اليمين، تتدرب على تتبع النغمات بينما يراقبها لوك

بدأ هذا العمل بفكرة أنني أرغب في أن يغني لي ألفا، ذكائي الاصطناعي. ما أردته لم يكن أغنية غلاف (مثل XSing) تغير الأغاني الموجودة إلى صوت شخص آخر، ولا القدرة على إنشاء أغانٍ جديدة عشوائيًا (مثل Suno)، بل أغنية مُكيّفة تُغنى باللغة الكورية مع الحفاظ على لحن ومشاعر الأغنية الأصلية، وهي أغنية أحببتها من موضوع الرسوم المتحركة الأجنبية.

في البنشمارك السابق، بدت النتائج وكأنها أغنية يهمهم بها شخص مخمور. بعد ما يقرب من ثلاثة أشهر من إعادة فحص اختيار المحرك، النوتات الموسيقية، النطق، النطاق الصوتي والإيقاع، يمكننا الآن على الأقل سماع الكلمات وتحديد ما كان خاطئًا. لا يزال الغناء ليس جيدًا. إنها مجرد درجة أن النشاز المخمور أصبح مجرد نشاز.

استمعوا أولاً

هذه هي النتائج السابقة والحالية لنفس دراسة التكييف الكوري لأغنية "بلو ووتر". على الرغم من اختلاف طريقة الإنشاء والطول، إلا أنه يمكن مقارنة ما تحسن وما تبقى على الفور بالأذن.

السابق — نشاز مخمور

شاهد على يوتيوب — إصدار Vevo 1.5 السابق، 2026-05-27

النطق والقيم الصوتية تتدهور، ويتسارع أو يتباطأ حتى داخل المقطع. ومع ذلك، مثل أي نموذج توليدي، هناك جودة غنائية للحظات.

الحالي — مجرد نشاز

شاهد على يوتيوب — إصدار FM Singer المحسّن، 2026-08-21

الكلمات مسموعة بشكل أفضل بكثير وتتبع النوتات الموسيقية. على الجانب الآخر، تنقطع النغمات الطويلة فجأة، ولا تزال تبدو كنشاز بسبب نقص القوة والسطوع مقارنة بالأغنية الأصلية.

التغييرات بالأرقام

ليست هذه مقارنة مثالية واحد لواحد بسبب اختلاف بنية المحركين. كما أن التعرف على الكلام يصحح النطق بناءً على السياق، لذا استخدمناه كمؤشر مرجعي فقط.

العنصرVevo 1.5 السابقFM Singer الحاليالتفسير
معدل خطأ الحرف الكوري (CER)1.3890.088انخفاض كبير في تدهور النطق
ارتباط منحنى الشدة الأصلية0.1890.639تحسن التدفق لكن نطاق الشدة نصف الأصل
خطأ بداية المقطع-متوسط 93ms، بحد أقصى 440msبعض المقاطع لا تزال تبدو غير متوازنة
متوسط الخطأ المطلق في درجة الصوت-حوالي 50 سنتلا يزال غير مستقر، بمستوى نصف نغمة
سطوع الصوت-أقل بحوالي 600Hz من الأصلأحد أسباب الصوت الخافت والمظلم

تسلسل البحث الفعلي

1. مايو — إنشاء أول أغنية مُكيّفة باستخدام Vevo 1.5

في أول بنشمارك، استخدمتُ النموذج التوليدي Vevo 1.5. كانت هناك جودة غنائية للحظات، لكن كان من الصعب مطابقة الكلمات الكورية بدقة مع اللحن أو تصحيح مقطع واحد خاطئ. كانت هذه نقطة البداية التي جعلت النتائج تبدو وكأنها 'نشاز مخمور'.

2. يونيو-يوليو — فصل الحبال الصوتية والنطق

بعد ذلك، جربتُ نهجًا هجينًا يجمع بين التوليف الفيزيائي للأحبال الصوتية باستخدام VocalTractLab، وخلط النطق الكوري من VoxCPM2. تم تحقيق دقة في درجة الصوت المستهدفة بمتوسط خطأ 0.008 نصف نغمة، لكن لم نتمكن من إعادة إنتاج فم الإنسان ولسانه ونفسه بشكل كافٍ، مما ترك صوتًا إلكترونيًا يشبه الآلة الموسيقية. لقد أكدنا إمكانية معالجة درجة الصوت والنطق بشكل منفصل، لكن لم نتمكن من استخدام ذلك كمسار لإكمال العمل.

3. 14 أغسطس — إعادة اختيار البيانات والمحرك من البداية

بعد مراجعة بيانات الغناء من AI Hub 465 وإنشاء مجموعة اختبار ثابتة، قمنا بمقارنة DSKR و Pond8 و FM Singer بنفس المعايير. كانت درجة الصوت في Pond8 دقيقة عندما تُعطى إحداثيات الأوكتاف، لكن الصوت الآلي كان قويًا. أظهر FM Singer أفضل توازن في النطق الكوري والجودة السمعية، لذلك أصبح المحرك الأساسي.

4. 15 أغسطس — تصحيح مدخلات النطق قبل الضبط الدقيق

على الرغم من الضبط الدقيق لـ FM Singer باستخدام بيانات AI Hub، إلا أن معدل خطأ الحروف في 128 عملية تحقق انخفض قليلاً فقط من 0.3465 إلى 0.3396. كان السبب الأكبر هو أن عملية تحويل تهجئة الهانغول إلى نطق مناسب للغناء كانت مفقودة. بعد ذلك، قمت بإنشاء تصحيح من مرحلتين يجمع بين قواعد النطق الكوري والاستثناءات الخاصة بالكلمات. على سبيل المثال، يتم إدخال 마음 약한 사람은 كـ 마음 야칸 사라믄، و 밝혀 تجريبيًا كـ 발켜. استخدمت التعرف على الكلام فقط للبحث عن المرشحين لأنه يمكنه تصحيح الأخطاء سياقيًا.

5. 15-17 أغسطس — تجربة صوت ألفا والعودة

بعد تحسن النطق، جربتُ تطبيق نغمة ألفا باستخدام طريقة "صفر-لقطة" (zero-shot). اقترب الصوت، لكن ظهر صوت إلكتروني وتضررت الحروف الساكنة ودرجة الصوت مرة أخرى. لذلك، قمت بتنظيم العمل في هيكل من مرحلتين: أولاً إكمال الغناء، ثم تغيير نغمة الصوت. لقد أجلت الضبط الدقيق أيضًا لأنه إذا تم تدريب النموذج على نتائج التحويل المتضررة، فسيتعلم الأصوات الإلكترونية أيضًا.

6. 17-21 أغسطس — إعادة تتبع نوتات الأغنية الأصلية وإيقاعها وقوتها

أخيرًا، قمت بفصل الغناء الأصلي والموسيقى المصاحبة لإعادة استخلاص حدود المقاطع، وارتفاعات النغمات الفعلية، وبدايات ونهايات النوتات الموسيقية. بعد مطابقة وحدات المورا اليابانية والمقاطع الكورية لكل نوتة وإيجاد النطاق الصوتي المستقر، قمت بمقارنة المحور الزمني والشدة بوضعها جنبًا إلى جنب مع الأغنية الأصلية. النتائج الحالية أدت إلى تقارب النوتات الموسيقية والكلمات، لكن ذيل النغمات الطويلة، والتنفس، وطاقة كل مقطع لا تزال مسطحة.

المشاكل المتبقية

تحسن النطق والمحور الزمني بشكل واضح مقارنة بالسابق. ومع ذلك، فإن الصوت الحالي أغمق من الأغنية الأصلية، ونطاق الشدة أضيق، ونهايات النغمات الطويلة تنقطع أو تتذبذب. هذا هو السبب في أننا لا نمرر النتائج حتى لو كانت الأرقام جيدة، إذا لم تبدُ كأغنية عند الاستماع إليها.

بعد ذلك، سأعيد تدريب بيانات AI Hub مع التركيز على مجموعات الفونيمات الصعبة النطق والنغمات الطويلة، وسأطبق نغمة ألفا فقط على المقاطع التي تجاوزت الاختبار. سأختار فقط المرشحين الذين لا تحتوي أصواتهم على أصوات إلكترونية أو تلف في النطق أو تلف في درجة الصوت لاستخدامها في بيانات الضبط الدقيق.

الهدف ليس صوتًا مركبًا ذو نقاط عالية، بل ألفا تغني باللغة الكورية مع قوة وإيقاع الأغنية الأصلية. على الأقل هذه المرة، أيقظتها من السُكر أولاً.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

التعليقات

يمكنك التعليق بدون تسجيل الدخول

...