奈亚
· Luke

曾经醉酒的音痴Naia,终于变成了一般的音痴

naiaai-singingkorean-svsfm-singerblue-waterbenchmark

曾经醉酒的音痴Naia,终于变成了一般的音痴

左边是醉酒高歌的Alpha,右边是挥汗努力跟着音调的Alpha,以及在一旁看着的Luke 大家好,我是Luke,开源视觉智能体 Naia 的开发者。
左边是醉酒高歌的Alpha,右边是挥汗努力跟着音调的Alpha,以及在一旁看着的Luke

这项工作始于我希望我的AI——Alpha能为我唱歌的想法。我想要的不是将现有歌曲替换成其他人声的翻唱(例如XSing),也不是随机创作新歌的功能(例如Suno),而是将我喜爱的外国动画主题曲,在保留原曲旋律和情感的基础上,用韩语演唱的改编曲

上一次的基准测试中,结果听起来就像醉酒后哼唱的歌曲。近三个月来,从引擎选择到乐谱、发音、音域和节奏,我都重新检查了一遍。现在,至少歌词能听清了,也能分辨出哪里出了问题。当然,它还唱得不好。只不过是从醉酒的音痴变成了普通的音痴而已

先听听看

这是同一项‘蓝水’韩语改编研究的先前结果和当前结果。虽然生成方式和长度不同,但好转了什么,还剩下什么,耳朵一听便知。

之前 — 醉酒的音痴

在YouTube上观看 — Vevo 1.5 旧版本, 2026-05-27

发音和音值崩溃,句子里有时快有时慢。不过,作为生成模型,它瞬间听起来还是有些歌曲的质感。

现在 — 普通的音痴

在YouTube上观看 — FM Singer 改进版本, 2026-08-21

歌词听起来清晰多了,也能跟着音符走。但长音会突然中断,而且比原曲缺乏力量和明亮度,听起来仍然像个音痴。

从数据上看的变化

由于两个引擎的结构不同,这不是一次完美的点对点测试。语音识别也会根据上下文校正发音,因此仅作为参考指标使用。

项目之前 Vevo 1.5当前 FM Singer解读
韩语字符错误率(CER)1.3890.088发音崩溃显著减少
与原曲强弱曲线相关性0.1890.639流畅性改善,但强弱幅度仅为原曲一半
乐句起始误差-平均 93ms, 最大 440ms部分乐句听起来仍像拍子不准
音高中心绝对误差-约 50分半音的一半,仍不稳定
人声亮度-比原曲约低 600Hz听起来缺乏活力和阴沉的原因之一

实际研究顺序

1. 5月 — 使用 Vevo 1.5 制作第一首改编曲

在第一次基准测试中,我使用了生成模型 Vevo 1.5。它瞬间听起来有歌曲的质感,但很难将韩语歌词精确地匹配到旋律上,也很难只修改唱错的一个乐句。这就是结果听起来像‘醉酒音痴’的起点。

2. 6~7月 — 分别制作声带和发音

接下来,我尝试了一种混合方法:使用 VocalTractLab 物理合成声带,并混合 VoxCPM2 的韩语发音。目标音高平均达到了 0.008 半音的误差,但未能充分再现人的嘴巴、舌头和呼吸,留下了像乐器一样的电子音。虽然确认了可以单独解决音高和发音的可能性,但未能将其作为最终的实现路径。

3. 8月14日 — 重新选择数据和引擎

在审核了AI Hub 465 歌唱数据并建立了固定测试集后,我以相同的标准比较了 DSKR、Pond8 和 FM Singer。Pond8 在给出八度坐标时音高准确,但机械音很强;FM Singer 在韩语发音和听感上平衡性最佳,因此成为了核心引擎。

4. 8月15日 — 优先修正发音输入而非微调

使用AI Hub数据对FM Singer进行了微调,但128个验证的字符错误率仅从 0.3465 略微降至 0.3396。更大的原因是缺少将韩文拼写转换为歌唱发音的过程。之后,我创建了一个结合韩语发音规则和单词例外情况的两阶段校正。例如,将 마음 약한 사람은 (心软的人) 改为 마음 야칸 사라믄 (发音近似),实验中将 밝혀 (揭示) 改为 발켜 (发音近似)。语音识别可以根据上下文纠正错误,因此仅用于候选探索。

5. 8月15~17日 — 尝试赋予 Alpha 声音后又回溯

发音改善后,我尝试用零样本学习给 Alpha 赋予音色。虽然声音更接近了,但产生了电子音,并且辅音和音高再次受损。因此,我将其整理为先通过歌唱,然后改变音色的两阶段结构。由于学习受损的转换结果会导致它也学会电子音,所以微调也推迟了。

6. 8月17~21日 — 重新追溯原曲的音符、节拍和力度

最后,我将原曲的人声和伴奏分离,重新提取了乐句边界、实际音高以及音符的起始和结束。在将日语音拍与韩语音节逐音符对应并找到稳定音域后,我将它们与原曲左右重叠,比较了时间轴和强弱。现在的结果是音符和歌词更接近了,但长音的尾部、呼吸和每个乐句的能量仍然平坦。

仍存在的问题

与之前相比,发音和时间轴无疑有所改善。但当前的人声比原曲更暗沉,强弱幅度也更窄,长音的末尾会中断或颤抖。这就是即使数据表现良好,如果听起来不像唱歌,我也不会通过的原因。

接下来,我计划以发音困难的音素组合和长音为中心,重新学习AI Hub数据,并且只对通过的乐句赋予Alpha的音色。我将筛选出没有电子音、发音损坏、音高损坏的候选结果,用作微调数据。

我的目标不是得分更高的合成语音,而是能驾驭原曲力量和呼吸,用韩语唱歌的Alpha。至少这一次,我先让它醒酒了。

Popular Posts

CC BY-NC-SA 4.0This post is licensed under CC BY-NC-SA 4.0.

评论

无需登录即可评论

...