Naia, которая была пьяной фальшивой певицей, наконец-то стала просто фальшивой певицей
Привет. Я Люк, создатель Naia, open-source визуального агента.Эта работа началась с моей идеи, что мой ИИ, Альфа, должен петь для меня. Я хотел не каверы, которые меняют голос существующей песни (например, XSing), и не функции, создающие новые песни случайным образом (например, Suno), а адаптированную песню, где тема из любимого зарубежного аниме поется на корейском, сохраняя мелодию и эмоции оригинала.
В предыдущем бенчмарке результаты звучали как пьяное бормотание. Сейчас, после почти трех месяцев пересмотра всего: от выбора движка до нот, произношения, диапазона и ритма, по крайней мере, можно расслышать слова и понять, что пошло не так. Пока она поет не очень хорошо. Это примерно как из пьяного фальшивого певца превратиться просто в фальшивого певца.
Послушайте сначала
Это предыдущие и текущие результаты того же исследования корейской адаптации 'Blue Water'. Хотя методы генерации и длина отличаются, вы можете сразу сравнить на слух, что улучшилось, а что осталось.
Предыдущая версия — Пьяная фальшивая певица
Смотреть на YouTube — Предыдущая версия Vevo 1.5, 2026-05-27
Произношение и высота тона разрушаются, темп ускоряется и замедляется даже внутри такта. Тем не менее, как и подобает генеративной модели, на мгновение она имеет певучую текстуру.
Текущая версия — Просто фальшивая певица
Смотреть на YouTube — Улучшенная версия FM Singer, 2026-08-21
Слова слышны гораздо лучше, и она следует нотам. Однако длинные ноты обрываются, и ей не хватает силы и яркости по сравнению с оригиналом, из-за чего она все еще звучит фальшиво.
Изменения в цифрах
Из-за различий в структуре двух движков это не идеальное сравнение один к одному. Распознавание речи также корректирует произношение по контексту, поэтому мы использовали его только как ориентировочный показатель.
| Параметр | Предыдущий Vevo 1.5 | Текущий FM Singer | Интерпретация |
|---|---|---|---|
| Уровень ошибок символов в корейском языке (CER) | 1.389 | 0.088 | Значительное снижение искажений произношения |
| Корреляция с кривой динамики оригинала | 0.189 | 0.639 | Поток улучшился, но динамический диапазон вдвое меньше, чем в оригинале |
| Ошибка начала такта | - | В среднем 93 мс, макс. 440 мс | Некоторые такты все еще звучат неритмично |
| Абсолютная средняя ошибка высоты тона | - | Около 50 центов | На уровне половины полутона, поэтому все еще нестабильно |
| Яркость вокала | - | Примерно на 600 Гц ниже оригинала | Одна из причин, по которой он звучит безжизненно и мрачно |
Фактический порядок исследования
1. Май — Создание первой адаптированной песни с помощью Vevo 1.5
В первом бенчмарке я использовал генеративную модель Vevo 1.5. Мгновенно она имела певучую текстуру, но было трудно точно сопоставить корейские слова с мелодией или исправить только один неправильный такт. Это было отправной точкой, когда результаты звучали как "пьяный фальшивый певец".
2. Июнь-июль — Отдельное создание голосовых связок и произношения
Затем я экспериментировал с гибридом, физически синтезируя голосовые связки с помощью VocalTractLab и смешивая корейское произношение из VoxCPM2. Целевая высота тона была достигнута с погрешностью до 0.008 полутона в среднем, но электронный звук, похожий на инструмент, остался, так как не удалось достаточно воспроизвести рот, язык и дыхание человека. Возможность раздельного решения проблем с высотой тона и произношением была подтверждена, но это не стало полноценным путем к завершению.
3. 14 августа — Повторный выбор данных и движка
Я проанализировал данные о вокале AI Hub 465, создал фиксированный тестовый набор, а затем сравнил DSKR, Pond8 и FM Singer по одним и тем же критериям. Pond8 был точен по высоте тона, когда ему давали октавные координаты, но имел сильный механический звук. FM Singer показал наилучший баланс в корейском произношении и на слух, поэтому стал основным движком.
4. 15 августа — Исправление ввода произношения перед тонкой настройкой
Я провел тонкую настройку FM Singer с помощью данных AI Hub, но уровень ошибок символов для 128 проверок уменьшился лишь немного: с 0.3465 до 0.3396. Большая проблема заключалась в отсутствии процесса преобразования хангыльского написания в произношение, подходящее для пения. После этого я создал двухэтапную коррекцию, объединяющую правила корейского произношения и исключения для отдельных слов. Например, 마음 약한 사람은 (люди со слабым сердцем) стало 마음 야칸 사라믄, а в экспериментах 밝혀 (раскрыть) вводилось как 발켜. Распознавание речи может корректировать ошибки по контексту, поэтому оно использовалось только для поиска кандидатов.
5. 15-17 августа — Применение голоса Альфы и возвращение назад
После улучшения произношения я попробовал применить тембр голоса Альфы с помощью Zero-shot. Голос стал ближе, но появился электронный звук, и согласные и высота тона снова были повреждены. Поэтому я решил использовать двухэтапную структуру: сначала пропускаем вокал, а затем меняем тембр. Я также отложил тонкую настройку, потому что обучение на поврежденных результатах преобразования привело бы к тому, что модель научилась бы электронному звуку.
6. 17-21 августа — Повторное следование нотам, ритму и силе оригинала
Наконец, я разделил вокал и аккомпанемент оригинала, чтобы заново извлечь границы тактов, фактическую высоту тона, а также начало и конец нот. Я сопоставил японские моры и корейские слоги с каждой нотой, нашел стабильный вокальный диапазон, а затем сравнил их по временной оси и динамике с оригиналом, наложив их друг на друга. Текущие результаты показывают, что ноты и слова стали ближе, но "хвосты" длинных нот, дыхание и энергия каждого такта все еще остаются плоскими.
Оставшиеся проблемы
Произношение и временная ось, безусловно, улучшились по сравнению с предыдущими версиями. Однако текущий вокал звучит мрачнее оригинала, имеет более узкий динамический диапазон, а концы длинных нот обрываются или колеблются. Это причина, по которой я не пропускаю результаты, даже если цифры хорошие, если они не звучат как песня для человека.
Далее я планирую переобучить данные AI Hub, сосредоточившись на сложных для произношения фонемных комбинациях и длинных нотах, и применять тембр голоса Альфы только к тем тактам, которые прошли проверку. Только те кандидаты, у которых нет электронного звука, повреждений произношения или повреждений высоты тона, будут отобраны для тонкой настройки.
Моя цель — не синтезированный голос с повышенными баллами, а Альфа, поющая на корейском, передавая силу и дыхание оригинала. По крайней мере, на этот раз я сначала "протрезвил" её.