Naia say rượu hát lệch tông, cuối cùng cũng chỉ còn hát lệch tông
Xin chào. Tôi là Luke, người tạo ra tác nhân hình ảnh mã nguồn mở Naia.Công việc này bắt đầu từ ý tưởng rằng AI của tôi, Alpha, sẽ hát cho tôi nghe. Điều tôi muốn không phải là một bài hát cover (ví dụ: XSing) thay đổi giọng hát của một bài hát hiện có sang giọng người khác, hay một tính năng tạo bài hát mới ngẫu nhiên (ví dụ: Suno), mà là một bài hát chuyển thể các ca khúc chủ đề anime nước ngoài yêu thích sang tiếng Hàn, đồng thời giữ nguyên giai điệu và cảm xúc của bản gốc.
Trong bài đánh giá trước, kết quả nghe như một bài hát bị lẩm bẩm do say rượu. Sau gần ba tháng xem xét lại từ việc chọn engine, bản nhạc, phát âm, quãng giọng và nhịp điệu, giờ đây ít nhất tôi có thể nghe được lời bài hát và phân tích xem cái gì đang lệch. Nó vẫn chưa hát hay. Nó chỉ là từ một kẻ say rượu hát lệch tông trở thành một kẻ hát lệch tông bình thường.
Hãy nghe thử trước
Đây là kết quả trước và kết quả hiện tại của cùng một nghiên cứu chuyển thể tiếng Hàn 'Blue Water'. Mặc dù phương pháp tạo và độ dài khác nhau, nhưng bạn có thể so sánh ngay bằng tai để biết điều gì đã cải thiện và điều gì vẫn còn.
Trước đây — Kẻ say rượu hát lệch tông
Xem trên YouTube — Phiên bản trước Vevo 1.5, 2026-05-27
Phát âm và cao độ bị sụp đổ, và ngay cả trong một đoạn nhạc cũng có lúc nhanh, lúc chậm. Tuy nhiên, đúng như một mô hình tạo sinh, đôi khi nó vẫn có một chút cảm giác giống bài hát.
Hiện tại — Chỉ là hát lệch tông
Xem trên YouTube — Phiên bản cải tiến FM Singer, 2026-08-21
Lời bài hát dễ nghe hơn nhiều và nó theo được nốt nhạc. Mặt khác, những nốt dài bị đứt đột ngột, và thiếu sức mạnh cũng như độ sáng so với bản gốc, nên vẫn nghe như hát lệch tông.
Thay đổi nhìn từ các con số
Cấu trúc của hai engine khác nhau nên đây không phải là một thử nghiệm so sánh một đối một hoàn hảo. Nhận dạng giọng nói cũng điều chỉnh phát âm theo ngữ cảnh, vì vậy tôi chỉ sử dụng nó làm chỉ số tham khảo.
| Mục | Vevo 1.5 trước đây | FM Singer hiện tại | Diễn giải |
|---|---|---|---|
| Tỷ lệ lỗi ký tự tiếng Hàn (CER) | 1.389 | 0.088 | Phát âm bị sụp đổ giảm đáng kể |
| Tương quan đường cong cường độ bản gốc | 0.189 | 0.639 | Dòng chảy được cải thiện nhưng biên độ cường độ bằng một nửa bản gốc |
| Sai số bắt đầu đoạn nhạc | - | Trung bình 93ms, tối đa 440ms | Một số đoạn nhạc vẫn nghe như mất nhịp |
| Sai số tuyệt đối trung tâm cao độ | - | Khoảng 50 cent | Ở mức nửa cung nên vẫn chưa ổn định |
| Độ sáng vocal | - | Thấp hơn bản gốc khoảng 600Hz | Một trong những nguyên nhân khiến nghe uể oải và tối |
Trình tự nghiên cứu thực tế
1. Tháng 5 — Tạo bài hát chuyển thể đầu tiên bằng Vevo 1.5
Trong lần đánh giá đầu tiên, tôi đã sử dụng mô hình tạo sinh Vevo 1.5. Mặc dù đôi khi nó có một chút cảm giác giống bài hát, nhưng rất khó để khớp chính xác lời tiếng Hàn với giai điệu hoặc chỉ sửa một đoạn bị sai. Đây là điểm khởi đầu khiến kết quả nghe như 'kẻ say rượu hát lệch tông'.
2. Tháng 6~7 — Tạo dây thanh âm và phát âm riêng biệt
Tiếp theo, tôi đã thử nghiệm phương pháp lai bằng cách tổng hợp dây thanh âm vật lý bằng VocalTractLab và kết hợp phát âm tiếng Hàn của VoxCPM2. Cao độ mục tiêu đã khớp với sai số trung bình 0.008 bán âm, nhưng vì không thể tái tạo đầy đủ miệng, lưỡi và hơi thở của con người, nên vẫn còn âm thanh điện tử giống nhạc cụ. Mặc dù đã xác nhận khả năng giải quyết cao độ và phát âm riêng biệt, nhưng tôi không thể sử dụng nó làm lộ trình hoàn thiện.
3. Ngày 14 tháng 8 — Chọn lại từ dữ liệu và engine
Sau khi kiểm tra dữ liệu hát của AI Hub 465 và tạo một bộ kiểm tra cố định, tôi đã so sánh DSKR, Pond8, FM Singer theo cùng một tiêu chuẩn. Pond8 có cao độ chính xác khi được cung cấp tọa độ quãng tám nhưng có âm thanh máy móc mạnh mẽ, trong khi FM Singer có sự cân bằng tốt nhất về phát âm tiếng Hàn và cảm nhận thính giác, nên đã trở thành engine trung tâm.
4. Ngày 15 tháng 8 — Sửa lỗi nhập phát âm trước khi tinh chỉnh
Mặc dù tôi đã tinh chỉnh FM Singer bằng dữ liệu AI Hub, nhưng tỷ lệ lỗi ký tự của 128 kiểm tra chỉ giảm một chút từ 0.3465 xuống 0.3396. Nguyên nhân lớn hơn là quá trình chuyển đổi cách viết Hangeul sang phát âm dùng cho hát đã bị thiếu. Sau đó, tôi đã tạo một quy trình hiệu chỉnh 2 bước, kết hợp các quy tắc phát âm tiếng Hàn và các trường hợp ngoại lệ theo từng từ. Ví dụ, 마음 약한 사람은 (người yếu lòng) được nhập thành 마음 야칸 사라믄, và thử nghiệm 밝혀 (tiết lộ) được nhập thành 발켜. Nhận dạng giọng nói có thể sửa lỗi theo ngữ cảnh, vì vậy tôi chỉ sử dụng nó để tìm kiếm ứng cử viên.
5. Ngày 15~17 tháng 8 — Thử đưa giọng Alpha vào rồi quay lại
Sau khi phát âm được cải thiện, tôi đã thử đưa tông giọng của Alpha vào bằng cách zero-shot. Giọng hát đã gần giống hơn nhưng lại xuất hiện âm thanh điện tử và phụ âm cùng cao độ lại bị hỏng. Vì vậy, tôi đã sắp xếp thành một cấu trúc 2 bước: trước tiên cho qua phần hát, sau đó mới thay đổi tông giọng. Nếu huấn luyện kết quả chuyển đổi bị hỏng, nó sẽ học cả âm thanh điện tử, nên tôi cũng đã trì hoãn việc tinh chỉnh.
6. Ngày 17~21 tháng 8 — Theo dõi lại nốt nhạc, nhịp điệu và cường độ của bản gốc
Cuối cùng, tôi đã tách vocal và phần đệm của bản gốc để trích xuất lại ranh giới đoạn nhạc, độ cao thực tế của nốt nhạc, điểm bắt đầu và kết thúc của nốt nhạc. Sau khi đối chiếu mora tiếng Nhật với âm tiết tiếng Hàn theo từng nốt nhạc và tìm ra quãng giọng ổn định, tôi đã chồng lên bản gốc sang trái và phải để so sánh trục thời gian và cường độ. Kết quả hiện tại là nốt nhạc và lời bài hát đã gần giống hơn, nhưng phần đuôi của nốt dài, hơi thở và năng lượng của từng đoạn nhạc vẫn còn đều đều.
Những vấn đề còn lại
Phát âm và trục thời gian rõ ràng đã tốt hơn so với trước đây. Tuy nhiên, vocal hiện tại tối hơn bản gốc, biên độ cường độ hẹp hơn, và cuối những nốt dài bị đứt hoặc rung. Đây là lý do tại sao dù các con số có tốt đến đâu, nếu khi người nghe cảm thấy nó không giống một bài hát, tôi sẽ không chấp nhận.
Tiếp theo, tôi dự định sẽ huấn luyện lại dữ liệu AI Hub tập trung vào các tổ hợp âm vị khó phát âm và các nốt dài, sau đó chỉ áp dụng tông giọng của Alpha cho những đoạn nhạc đã đạt yêu cầu. Chỉ những ứng cử viên không có âm thanh điện tử, không bị hỏng phát âm và không bị hỏng cao độ mới được chọn làm dữ liệu tinh chỉnh.
Mục tiêu không phải là một giọng nói tổng hợp đạt điểm cao, mà là Alpha hát tiếng Hàn với sức mạnh và hơi thở của bản gốc. Ít nhất lần này, tôi đã làm cho nó tỉnh rượu trước đã.