FireRedTeam Ra Mắt FireRedAudio Và FireRedTTS3 Giúp Hợp Nhất Hiểu Và Tạo Âm Thanh
FireRedTeam đã phát hành FireRedAudio, một mô hình ngôn ngữ âm thanh đa dụng quy mô 9 tỷ tham số, cùng với FireRedTTS3, một hệ thống chỉnh sửa và tạo giọng nói thống nhất. FireRedAudio sở hữu kiến trúc mới giúp tách biệt các đường dẫn hiểu và tạo âm thanh trong khi vẫn chia sẻ chung một mạng xương sống LLM. Bản phát hành này cung cấp cho cộng đồng mã nguồn mở một mô hình thống nhất có khả năng xử lý toàn bộ tác vụ âm thanh, bao gồm nhận dạng giọng nói, chuyển văn bản thành giọng nói zero-shot và chỉnh sửa giọng nói. Thiết kế biểu diễn tách biệt của nó giúp ngăn chặn sự can thiệp lẫn nhau giữa các tác vụ hiểu và tạo, thiết lập một tiêu chuẩn mới cho các mô hình ngôn ngữ âm thanh. FireRedAudio hỗ trợ định vị thời gian (temporal grounding) chính xác cho các tệp âm thanh dài tối đa một giờ. FireRedTTS3 hỗ trợ sao chép giọng nói zero-shot trên 24 ngôn ngữ (bao gồm cả tiếng Việt), 21 phương ngữ Trung Quốc, và thiết kế giọng nói dựa trên hướng dẫn bằng văn bản.
## KIẾN THỨC NỀN
Các mô hình âm thanh truyền thống thường tách biệt việc chuyển giọng nói thành văn bản (hiểu) và chuyển văn bản thành giọng nói (tạo) thành các hệ thống riêng biệt, hoặc gặp khó khăn khi cân bằng cả hai trong một mô hình duy nhất. Định vị thời gian (temporal grounding) là quá trình liên kết các mốc thời gian cụ thể trong bản ghi âm với nội dung văn bản hoặc ngữ nghĩa tương ứng. Các biểu diễn liên tục tách biệt (decoupled continuous representations) giúp giải quyết vấn đề này bằng cách sử dụng các đường dẫn riêng biệt cho việc mã hóa và giải mã trong khi vẫn tận dụng chung một mô hình suy luận.