Alibaba ra mắt dòng mô hình Qwen-Audio-3.1 và giảm giá API tới 95%
Nhóm Qwen của Alibaba đã chính thức ra mắt bộ mô hình âm thanh Qwen-Audio-3.1, mang đến các nâng cấp toàn diện cho nhận dạng giọng nói, tổng hợp giọng nói và tương tác thời gian thực cùng các kiến trúc thế hệ mới ASR-Next và TTS-Next. Đồng thời, giá dịch vụ API trên toàn bộ các mô hình âm thanh đã được giảm mạnh, trong đó ASR giảm 95%, Realtime giảm 85% và TTS giảm 70%. Đợt phát hành này giúp hạ thấp đáng kể rào cản chi phí cho các nhà phát triển ứng dụng dựa trên âm thanh, từ gỡ băng trực tuyến đến sáng tạo nội dung âm thanh hoàn chỉnh cho podcast và trò chơi. Bằng cách cung cấp khả năng giữ nhất quán giọng nói nhiều nhân vật và tích hợp âm thanh môi trường với mức giá rẻ hơn nhiều, Alibaba đang đẩy nhanh việc triển khai AI âm thanh thời gian thực trong nhiều ngành công nghiệp. Qwen-Audio-3.1-ASR hỗ trợ 30 ngôn ngữ và 16 biến thể tiếng địa phương Trung Quốc với độ trễ phản hồi ký tự đầu tiên khoảng 160 miligiây cùng tính năng tự động chuẩn hóa văn bản. Ngoài ra, Qwen-Audio-3.1-TTS-Next có thể hợp nhất tạo hội thoại, hiệu ứng âm thanh và nhạc nền chỉ trong một luồng xử lý duy nhất mà vẫn duy trì tính nhất quán chất giọng nhân vật.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn âm thanh (Audio LLMs) mở rộng mô hình văn bản truyền thống bằng cách trực tiếp xử lý và tạo ra tín hiệu sóng âm, thay thế hệ thống phân tầng cũ vốn tách rời nhận dạng giọng nói, suy luận văn bản và tổng hợp giọng nói. Kiến trúc Qwen-Audio trước đó của Alibaba đã hợp nhất các tác vụ hiểu giọng nói, âm nhạc và tiếng động vào một mô hình Transformer nền tảng duy nhất.