~/AI/iflytek-launches-spark-audio-1-0-preview-end-to-end-audio-model

iFlytek Ra Mắt Spark-Audio-1.0-Preview Model Âm Thanh Đầu-Cuối Huấn Luyện Trên Hạ Tầng Nội Địa

iFlytek vừa công bố Spark-Audio-1.0-Preview, một mô hình nền tảng âm thanh đầu-cuối được huấn luyện hoàn toàn trên hạ tầng phần cứng nội địa Trung Quốc. Kết hợp bộ mã hóa âm thanh 0.65B với mô hình ngôn ngữ MoE 30B, mô hình có khả năng hiểu trực tiếp giọng nói, cảm xúc, ngữ điệu và âm thanh môi trường mà không cần thông qua các bước chuyển từ thoại sang văn bản truyền thống. Phát triển này thể hiện năng lực ngày càng tăng của Trung Quốc trong việc huấn luyện các mô hình AI đa thức cạnh tranh hoàn toàn trên hạ tầng tính toán nội địa giữa bối cảnh bị kiểm soát xuất khẩu. Bằng cách loại bỏ bước chuyển đổi văn bản trung gian, mô hình âm thanh gốc giúp triệt tiêu độ trễ xử lý và tránh mất mát thông tin âm thanh, tạo ra tiêu chuẩn mới cho tương tác giọng nói thời gian thực. Được huấn luyện trên 13 triệu giờ âm thanh cùng tập dữ liệu văn bản quy mô lớn, Spark-Audio-1.0-Preview hỗ trợ nhận dạng 99 ngôn ngữ và 202 tiếng địa phương. Kết quả đánh giá cho thấy mô hình đạt SOTA trên tập kiểm thử Fleurs tiếng Trung và vượt qua Gemini-3.1 Pro ở các tác vụ nhận dạng giọng nói đa ngôn ngữ, đặc biệt hoạt động tốt trong môi trường nhiều tiếng ồn hoặc âm lượng nhỏ.

## KIẾN THỨC NỀN

Xử lý giọng nói truyền thống thường dùng kiến trúc nối tầng (cascaded), nơi âm thanh được chuyển thành văn bản trước khi đưa vào mô hình ngôn ngữ lớn, gây ra độ trễ và làm mất các ngữ cảnh phi ngôn ngữ như cảm xúc hay âm thanh nền. Bên cạnh đó, kiến trúc Mixture-of-Experts (MoE) như dòng 30B-A3B cho phép định tuyến dữ liệu đầu vào đến các mạng con chuyên biệt, chỉ kích hoạt một lượng nhỏ tham số (như 3B mỗi token) để tối ưu hiệu quả tính toán.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI#Audio Foundation Model#Speech Processing#MoE#iFlytek

$ subscribe --daily

iFlytek Ra Mắt Spark-Audio-1.0-Preview Model Âm Thanh Đầu-Cuối Huấn Luyện Trên Hạ Tầng Nội Địa | Daily News