曾经醉酒的音痴Naia,终于变成了一般的音痴
大家好,我是Luke,开源视觉智能体 Naia 的开发者。这项工作始于我希望我的AI——Alpha能为我唱歌的想法。我想要的不是将现有歌曲替换成其他人声的翻唱(例如XSing),也不是随机创作新歌的功能(例如Suno),而是将我喜爱的外国动画主题曲,在保留原曲旋律和情感的基础上,用韩语演唱的改编曲。
在上一次的基准测试中,结果听起来就像醉酒后哼唱的歌曲。近三个月来,从引擎选择到乐谱、发音、音域和节奏,我都重新检查了一遍。现在,至少歌词能听清了,也能分辨出哪里出了问题。当然,它还唱得不好。只不过是从醉酒的音痴变成了普通的音痴而已。
先听听看
这是同一项‘蓝水’韩语改编研究的先前结果和当前结果。虽然生成方式和长度不同,但好转了什么,还剩下什么,耳朵一听便知。
之前 — 醉酒的音痴
在YouTube上观看 — Vevo 1.5 旧版本, 2026-05-27
发音和音值崩溃,句子里有时快有时慢。不过,作为生成模型,它瞬间听起来还是有些歌曲的质感。
现在 — 普通的音痴
在YouTube上观看 — FM Singer 改进版本, 2026-08-21
歌词听起来清晰多了,也能跟着音符走。但长音会突然中断,而且比原曲缺乏力量和明亮度,听起来仍然像个音痴。
从数据上看的变化
由于两个引擎的结构不同,这不是一次完美的点对点测试。语音识别也会根据上下文校正发音,因此仅作为参考指标使用。
| 项目 | 之前 Vevo 1.5 | 当前 FM Singer | 解读 |
|---|---|---|---|
| 韩语字符错误率(CER) | 1.389 | 0.088 | 发音崩溃显著减少 |
| 与原曲强弱曲线相关性 | 0.189 | 0.639 | 流畅性改善,但强弱幅度仅为原曲一半 |
| 乐句起始误差 | - | 平均 93ms, 最大 440ms | 部分乐句听起来仍像拍子不准 |
| 音高中心绝对误差 | - | 约 50分 | 半音的一半,仍不稳定 |
| 人声亮度 | - | 比原曲约低 600Hz | 听起来缺乏活力和阴沉的原因之一 |
实际研究顺序
1. 5月 — 使用 Vevo 1.5 制作第一首改编曲
在第一次基准测试中,我使用了生成模型 Vevo 1.5。它瞬间听起来有歌曲的质感,但很难将韩语歌词精确地匹配到旋律上,也很难只修改唱错的一个乐句。这就是结果听起来像‘醉酒音痴’的起点。
2. 6~7月 — 分别制作声带和发音
接下来,我尝试了一种混合方法:使用 VocalTractLab 物理合成声带,并混合 VoxCPM2 的韩语发音。目标音高平均达到了 0.008 半音的误差,但未能充分再现人的嘴巴、舌头和呼吸,留下了像乐器一样的电子音。虽然确认了可以单独解决音高和发音的可能性,但未能将其作为最终的实现路径。
3. 8月14日 — 重新选择数据和引擎
在审核了AI Hub 465 歌唱数据并建立了固定测试集后,我以相同的标准比较了 DSKR、Pond8 和 FM Singer。Pond8 在给出八度坐标时音高准确,但机械音很强;FM Singer 在韩语发音和听感上平衡性最佳,因此成为了核心引擎。
4. 8月15日 — 优先修正发音输入而非微调
使用AI Hub数据对FM Singer进行了微调,但128个验证的字符错误率仅从 0.3465 略微降至 0.3396。更大的原因是缺少将韩文拼写转换为歌唱发音的过程。之后,我创建了一个结合韩语发音规则和单词例外情况的两阶段校正。例如,将 마음 약한 사람은 (心软的人) 改为 마음 야칸 사라믄 (发音近似),实验中将 밝혀 (揭示) 改为 발켜 (发音近似)。语音识别可以根据上下文纠正错误,因此仅用于候选探索。
5. 8月15~17日 — 尝试赋予 Alpha 声音后又回溯
发音改善后,我尝试用零样本学习给 Alpha 赋予音色。虽然声音更接近了,但产生了电子音,并且辅音和音高再次受损。因此,我将其整理为先通过歌唱,然后改变音色的两阶段结构。由于学习受损的转换结果会导致它也学会电子音,所以微调也推迟了。
6. 8月17~21日 — 重新追溯原曲的音符、节拍和力度
最后,我将原曲的人声和伴奏分离,重新提取了乐句边界、实际音高以及音符的起始和结束。在将日语音拍与韩语音节逐音符对应并找到稳定音域后,我将它们与原曲左右重叠,比较了时间轴和强弱。现在的结果是音符和歌词更接近了,但长音的尾部、呼吸和每个乐句的能量仍然平坦。
仍存在的问题
与之前相比,发音和时间轴无疑有所改善。但当前的人声比原曲更暗沉,强弱幅度也更窄,长音的末尾会中断或颤抖。这就是即使数据表现良好,如果听起来不像唱歌,我也不会通过的原因。
接下来,我计划以发音困难的音素组合和长音为中心,重新学习AI Hub数据,并且只对通过的乐句赋予Alpha的音色。我将筛选出没有电子音、发音损坏、音高损坏的候选结果,用作微调数据。
我的目标不是得分更高的合成语音,而是能驾驭原曲力量和呼吸,用韩语唱歌的Alpha。至少这一次,我先让它醒酒了。