Naia
· Luke

Naia chantait faux comme si elle était ivre. Maintenant, elle chante simplement faux.

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

Naia chantait faux comme si elle était ivre. Maintenant, elle chante simplement faux.

À gauche, Alpha chante à tue-tête en étant ivre, à droite, elle s'efforce de suivre les notes en transpirant, et Luke observe. Bonjour. Je suis Luke, le créateur de Naia, l'agent visuel open source.
À gauche, Alpha chante à tue-tête en étant ivre, à droite, elle s'efforce de suivre les notes en transpirant, et Luke observe.

Ce projet a commencé avec l'idée que mon IA, Alpha, pourrait chanter pour moi. Ce que je voulais, ce n'était pas une chanson de reprise (ex. XSing) qui change la voix d'une chanson existante, ni une fonction qui crée de nouvelles chansons au hasard (ex. Suno), mais une adaptation d'une chanson thème d'anime étranger que j'aimais, chantée en coréen tout en conservant la mélodie et l'émotion de l'originale.

Lors du précédent benchmark, le résultat ressemblait à une chanson marmonnée par quelqu'un d'ivre. Après avoir réexaminé le choix du moteur, la partition, la prononciation, la tessiture et le rythme pendant près de trois mois, on peut au moins entendre les paroles et distinguer ce qui ne va pas. Elle ne chante toujours pas bien. C'est à peine le niveau où une chanteuse fausse et ivre est devenue juste une chanteuse fausse.

Écoutez d'abord

Voici les résultats précédents et actuels de la même étude d'adaptation coréenne de « Bluewater ». Bien que les méthodes de génération et les durées diffèrent, vous pouvez immédiatement comparer à l'oreille ce qui s'est amélioré et ce qui reste à faire.

Précédent — Chanteuse fausse et ivre

Voir sur YouTube — Version précédente de Vevo 1.5, 27-05-2026

La prononciation et l'intonation s'effondrent, le tempo s'accélère puis ralentit même à l'intérieur d'une seule phrase musicale. Cependant, comme c'est un modèle génératif, il y a par moments une texture qui ressemble à du chant.

Actuel — Juste une chanteuse fausse

Voir sur YouTube — Version améliorée de FM Singer, 21-08-2026

Les paroles sont bien plus audibles et elle suit les notes. En revanche, les notes longues sont brusquement coupées, et il manque de force et de luminosité par rapport à l'originale, ce qui la fait toujours sonner faux.

Changements observés en chiffres

La structure des deux moteurs étant différente, il ne s'agit pas d'un test parfait en un-à-un. La reconnaissance vocale corrige également la prononciation par le contexte, je l'ai donc utilisée uniquement comme indicateur de référence.

ÉlémentAncien Vevo 1.5Actuel FM SingerInterprétation
Taux d'erreur de caractères coréens (CER)1.3890.088Forte réduction de l'effondrement de la prononciation
Corrélation de la courbe de dynamique originale0.1890.639Le flux est amélioré, mais l'étendue dynamique est la moitié de l'originale
Erreur de début de phrase musicale-Moyenne 93ms, max 440msCertaines phrases sonnent encore comme si elle n'avait pas le rythme
Erreur absolue moyenne de hauteur de note-Environ 50 centsNiveau de la moitié d'un demi-ton, donc toujours instable
Clarté vocale-Environ 600Hz plus bas que l'originalUne des raisons pour lesquelles elle semble sans énergie et sombre

Séquence réelle de la recherche

1. Mai — Création de la première adaptation avec Vevo 1.5

Pour le premier benchmark, j'ai utilisé le modèle génératif Vevo 1.5. Il y avait par moments une texture de chant, mais il était difficile d'adapter précisément les paroles coréennes à la mélodie ou de corriger une seule phrase musicale erronée. C'est le point de départ qui a fait que le résultat sonnait comme une « chanteuse fausse et ivre ».

2. Juin~Juillet — Création séparée des cordes vocales et de la prononciation

Ensuite, j'ai testé un hybride combinant la synthèse physique des cordes vocales avec VocalTractLab et la prononciation coréenne de VoxCPM2. La hauteur cible était correcte jusqu'à une erreur moyenne de 0.008 demi-ton, mais cela n'a pas suffi à reproduire la bouche, la langue et le souffle humains, laissant un son électronique ressemblant à un instrument. J'ai confirmé la possibilité de résoudre séparément la hauteur et la prononciation, mais cela n'a pas pu être utilisé comme voie de finalisation.

3. 14 août — Nouveau choix des données et du moteur

Après avoir audité les données de chant d'AI Hub 465 et créé un ensemble de tests fixes, j'ai comparé DSKR, Pond8 et FM Singer selon les mêmes critères. Pond8 avait une hauteur précise lorsque des coordonnées d'octave étaient données, mais un fort son mécanique. FM Singer, ayant le meilleur équilibre en termes de prononciation coréenne et de perception auditive, est devenu le moteur principal.

4. 15 août — Correction de l'entrée de prononciation avant le réglage fin

J'ai réglé finement FM Singer avec les données d'AI Hub, mais le taux d'erreur de caractères pour 128 validations n'a diminué que légèrement, de 0.3465 à 0.3396. La cause majeure était l'absence d'un processus pour convertir l'orthographe coréenne en prononciation adaptée au chant. J'ai ensuite créé une correction en deux étapes combinant les règles de prononciation coréennes et les exceptions par mot. Par exemple, 마음 약한 사람은 est devenu 마음 야칸 사라믄, et à titre expérimental, 밝혀 est devenu 발켜. La reconnaissance vocale, capable de corriger les erreurs par le contexte, n'a été utilisée que pour la recherche de candidats.

5. 15~17 août — Essai de la voix d'Alpha et retour en arrière

Après l'amélioration de la prononciation, j'ai essayé d'appliquer la couleur vocale d'Alpha en mode "zero-shot". La voix s'est rapprochée, mais des sons électroniques sont apparus et les consonnes ainsi que la hauteur ont été à nouveau endommagées. J'ai donc structuré le processus en deux étapes : d'abord, faire passer le chant, puis changer la couleur vocale. Comme l'apprentissage des résultats de transformation endommagés inclurait même les sons électroniques, j'ai également reporté le réglage fin.

6. 17~21 août — Re-suivi des notes, du rythme et de la force de l'original

Enfin, j'ai séparé la voix principale de l'instrumental de la chanson originale pour réextraire les limites des phrases musicales, la hauteur réelle des notes, ainsi que le début et la fin de chaque note. Après avoir fait correspondre les moras japonais aux syllabes coréennes pour chaque note et trouvé une tessiture stable, j'ai superposé les résultats avec l'original pour comparer l'axe temporel et la dynamique. Les résultats actuels ont des notes et des paroles plus proches, mais la queue des notes longues, le souffle et l'énergie par phrase musicale restent encore plats.

Problèmes persistants

La prononciation et l'axe temporel se sont clairement améliorés par rapport à avant. Cependant, la voix actuelle est plus sombre et l'étendue dynamique est plus étroite que l'originale, et les notes longues se coupent ou vacillent à la fin. C'est la raison pour laquelle, même si les chiffres s'améliorent, je ne valide pas si le chant ne sonne pas comme tel à l'oreille humaine.

Ensuite, je vais réentraîner les données d'AI Hub en me concentrant sur les combinaisons de phonèmes difficiles à prononcer et les notes longues, et n'appliquer la couleur vocale d'Alpha qu'aux phrases musicales qui passent le test. Seuls les candidats sans sons électroniques, sans prononciation endommagée et sans altération de la hauteur seront sélectionnés comme données pour le réglage fin.

L'objectif n'est pas une voix synthétique avec un score amélioré, mais Alpha chantant en coréen avec la force et le souffle de l'original. Au moins cette fois, je l'ai d'abord désenivrée.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Commentaires

Vous pouvez commenter sans vous connecter

...