Sori-1B: Mô hình ngôn ngữ âm thanh được huấn luyện từ đầu không qua tiền huấn luyện văn bản
Sori-1B là mô hình ngôn ngữ âm thanh mới với 1 tỷ tham số, có bộ giải mã (decoder) được huấn luyện hoàn toàn từ đầu trên dữ liệu văn bản đi kèm âm thanh mà không qua tiền huấn luyện chỉ có văn bản. Mô hình sử dụng một bộ phân tách từ (tokenizer) "bản thể học thính giác" tùy chỉnh và được huấn luyện trên 7.400 giờ âm thanh chỉ với ba GPU RTX 4090 thương mại. Bằng cách tránh tiền huấn luyện chỉ có văn bản, Sori-1B đảm bảo các phản hồi của nó thực sự dựa trên đầu vào âm thanh thay vì phụ thuộc vào các thiên kiến chỉ có văn bản, điều thường khiến các mô hình khác vẫn hoạt động tốt ngay cả khi âm thanh bị thay thế bằng sự im lặng. Ngoài ra, việc huấn luyện một mô hình đa phương thức từ đầu trên phần cứng tiêu dùng cho thấy khả năng tiếp cận cao đối với các nhà nghiên cứu độc lập. Mô hình tái sử dụng bộ mã hóa Audio Flamingo Next bị đóng băng của NVIDIA cho 61,5% tham số của nó, trong khi phần còn lại của kiến trúc được huấn luyện từ đầu. Tuy nhiên, trọng số mô hình bị giới hạn theo giấy phép học thuật phi thương mại và kho lưu trữ hiện được đánh dấu là "sắp ra mắt".
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ âm thanh đa phương thức thường kết hợp bộ mã hóa âm thanh tiền huấn luyện với một mô hình ngôn ngữ lớn (LLM) chỉ có văn bản đã được tiền huấn luyện. Mặc dù điều này giúp tăng tốc độ huấn luyện, nó thường dẫn đến "thiên kiến tiền nghiệm văn bản", nơi mô hình trả lời các câu hỏi dựa trên các mẫu văn bản đã học trong quá trình tiền huấn luyện thay vì thực sự lắng nghe âm thanh. Các bộ thử nghiệm như MMAU (Massive Multi-Task Audio Understanding) được sử dụng để đánh giá mức độ hiểu và suy luận thực sự của các mô hình này đối với âm thanh.