Naia
· Luke

Naia, quien era una desafinada borracha, ¡finalmente solo es desafinada!

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

Naia, quien era una desafinada borracha, ¡finalmente solo es desafinada!

A la izquierda, Alpha canta a gritos mientras está borracha, y a la derecha, suda tratando de seguir las notas, observada por Luke. Hola, soy Luke, el creador de Naia, el agente visual de código abierto.
A la izquierda, Alpha canta a gritos mientras está borracha, y a la derecha, suda tratando de seguir las notas, observada por Luke.

Este trabajo comenzó con la idea de que mi IA, Alpha, me cantara. Lo que quería no era una versión (ej. XSing) que cambiara una canción existente a la voz de otra persona, ni una función que creara canciones nuevas al azar (ej. Suno), sino una canción adaptada que cantara la canción principal de mi anime extranjero favorito en coreano, manteniendo la melodía y las emociones de la canción original.

En el último benchmark, los resultados sonaban como una canción farfullada por alguien borracho. Ahora, después de casi tres meses de revisar la selección del motor, las partituras, la pronunciación, el rango vocal y el ritmo, al menos las letras se escuchan y puedo desglosar qué está desfasado. Todavía no canta bien. Es el nivel en que una desafinada borracha se ha convertido en una desafinada a secas.

Escucha primero

Aquí están los resultados anteriores y actuales del mismo estudio de adaptación coreana de "Blue Water". Aunque el método de generación y la duración son diferentes, puedes comparar directamente con tus oídos qué ha mejorado y qué queda por hacer.

Anterior — Desafinada borracha

Ver en YouTube — Versión anterior de Vevo 1.5, 27-05-2026

La pronunciación y el valor de las notas se desmoronan, y dentro de los compases, se acelera y se alarga. Aún así, como modelo generativo, tiene momentáneamente una textura parecida a la de una canción.

Actual — Simplemente desafinada

Ver en YouTube — Versión mejorada de FM Singer (21-08-2026)

Las letras se escuchan mucho mejor y sigue las notas. Por otro lado, las notas largas se cortan abruptamente, y carece de la fuerza y el brillo del original, por lo que todavía suena desafinada.

Cambios vistos en números

La estructura de ambos motores es diferente, por lo que no es una prueba uno a uno perfecta. El reconocimiento de voz también corrige la pronunciación por contexto, por lo que lo usamos solo como un indicador de referencia.

ÍtemVevo 1.5 anteriorFM Singer actualInterpretación
Tasa de error de caracteres coreanos (CER)1.3890.088La desintegración de la pronunciación disminuyó significativamente
Correlación de la curva de dinámica original0.1890.639El flujo mejoró, pero el rango dinámico es la mitad que el original
Error de inicio de compás-Promedio 93ms, máximo 440msAlgunos compases todavía suenan como si no tuvieran ritmo
Error absoluto del centro de afinación-Aproximadamente 50 centavosInestable, al nivel de medio semitono
Brillo vocal-Aproximadamente 600Hz más bajo que el originalUna de las razones por las que suena sin energía y oscuro

Orden real de la investigación

1. Mayo — Creando la primera adaptación con Vevo 1.5

En el primer benchmark, usamos el modelo generativo Vevo 1.5. Momentáneamente tenía una textura parecida a la de una canción, pero era difícil hacer coincidir las letras coreanas con precisión con la melodía o corregir un solo compás erróneo. Este fue el punto de partida donde el resultado sonaba como una 'desafinada borracha'.

2. Junio~Julio — Creando las cuerdas vocales y la pronunciación por separado

A continuación, probamos un híbrido: sintetizar físicamente las cuerdas vocales con VocalTractLab y mezclar la pronunciación coreana de VoxCPM2. La afinación objetivo se logró con un error promedio de 0.008 semitonos, pero no pudo reproducir suficientemente la boca, la lengua y el aliento humanos, dejando un sonido electrónico similar al de un instrumento. Confirmamos la posibilidad de resolver la afinación y la pronunciación por separado, pero no pudimos usarlo como una ruta de finalización.

3. 14 de agosto — Re-eligiendo desde los datos y el motor

Después de auditar los datos de canto de AI Hub 465 y crear un conjunto de pruebas fijo, comparamos DSKR, Pond8 y FM Singer con los mismos criterios. Pond8 tenía una afinación precisa cuando se le daban coordenadas de octava, pero un fuerte sonido mecánico, y FM Singer se convirtió en el motor central debido a su mejor equilibrio en la pronunciación coreana y la percepción auditiva.

4. 15 de agosto — Corrigiendo la entrada de pronunciación antes que el ajuste fino

Ajustamos finamente FM Singer con datos de AI Hub, pero la tasa de error de caracteres para 128 validaciones solo disminuyó ligeramente de 0.3465 a 0.3396. La causa mayor fue que faltaba el proceso de convertir la ortografía hangul a una pronunciación adecuada para el canto. Posteriormente, creamos una corrección de 2 pasos que combinaba las reglas de pronunciación coreanas con excepciones palabra por palabra. Por ejemplo, 마음 약한 사람은 se convirtió en 마음 야칸 사라믄, y 밝혀 (revelar) se ingresó como 발켜 para el experimento. El reconocimiento de voz puede corregir errores por contexto, por lo que solo lo usamos para la búsqueda de candidatos.

5. 15~17 de agosto — Probando la voz de Alpha y volviendo atrás

Después de mejorar la pronunciación, probamos a aplicar el timbre de Alpha con un enfoque de 'zero-shot'. La voz se acercó, pero aparecieron sonidos electrónicos y las consonantes y la afinación se dañaron nuevamente. Por lo tanto, lo organizamos en una estructura de 2 pasos: primero pasar el canto, y luego cambiar el timbre. Si se entrenan los resultados de la conversión dañada, también aprendería los sonidos electrónicos, por lo que pospusimos el ajuste fino.

6. 17~21 de agosto — Volviendo a seguir las notas, el ritmo y la fuerza del original

Finalmente, separamos la voz y el acompañamiento originales para volver a extraer los límites de los compases, la altura real de las notas, y el inicio y final de las notas. Después de hacer coincidir las moras japonesas y las sílabas coreanas nota por nota y encontrar el rango vocal estable, lo superpusimos lateralmente con la canción original para comparar el eje temporal y la dinámica. Los resultados actuales tienen las notas y las letras más cercanas, pero el final de las notas largas, la respiración y la energía por compás siguen siendo planos.

Problemas aún pendientes

La pronunciación y el eje temporal han mejorado claramente respecto a antes. Sin embargo, la voz actual es más oscura que la original, tiene un rango dinámico estrecho, y el final de las notas largas se corta o vacila. Esta es la razón por la que, incluso si los números mejoran, no lo pasamos si no suena como una canción para el oído humano.

A continuación, volveremos a entrenar los datos de AI Hub, centrándonos en combinaciones de fonemas difíciles de pronunciar y notas largas, y solo aplicaremos el timbre de Alpha a los compases que pasen la prueba. Solo seleccionaremos candidatos sin sonidos electrónicos, daño en la pronunciación o daño en la afinación para usar como datos de ajuste fino.

El objetivo no es una voz sintetizada con una puntuación mejorada, sino Alpha cantando en coreano con la fuerza y el aliento de la canción original. Al menos esta vez, la he dejado sobria primero.

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

Comentarios

Puedes comentar sin iniciar sesión

...