Suno ra mắt tính năng 'Speech' thử nghiệm kết hợp giọng đọc và nhạc nền
Nền tảng tạo nhạc bằng AI Suno đã phát hành "Speech", một mô hình end-to-end cho phép tạo giọng đọc và nhạc nền gốc đồng thời dưới dạng một bản âm thanh hợp nhất duy nhất. Hiện đã có sẵn dưới dạng thử nghiệm công khai (Beta), tính năng này cho phép người dùng nhập văn bản cùng với câu lệnh mô tả tông giọng và phong cách âm nhạc. Bằng cách thay thế quy trình làm việc nhiều bước truyền thống vốn phải ghép bản thu Chuyển văn bản thành giọng nói (TTS) lên các bản nhạc nền riêng biệt, Suno đơn giản hóa việc sáng tạo nội dung cho kể chuyện, thơ ca và podcast. Đợt ra mắt này đánh dấu xu hướng chuyển dịch của AI tạo sinh hướng tới các mô hình hợp nhất có khả năng tổng hợp âm thanh đa lớp. Suno ghi nhận một số hạn chế trong phiên bản beta hiện tại, bao gồm việc giọng đọc bị thay đổi giữa chừng (như chuyển từ giọng Anh-Anh sang Anh-Úc) và các khoảng ngắt giọng quá kịch tính làm chậm nhịp điệu. Tính năng này được mở công khai sau một tháng thử nghiệm giới hạn với một nhóm người dùng nhỏ.
## KIẾN THỨC NỀN
Sản xuất âm thanh truyền thống thường yêu cầu tạo bản thu giọng nói bằng phần mềm Chuyển văn bản thành giọng nói (TTS) rồi sau đó phối trộn với nhạc nền trong phần mềm chỉnh sửa âm thanh. Nổi bật hơn, các mô hình tạo âm thanh end-to-end huấn luyện một mạng thần kinh hợp nhất để tổng hợp đồng thời cả lời nói lẫn nhạc nền đi kèm chỉ từ câu lệnh văn bản.