~/AI ML/alibaba-launches-qwen-audio-3-0-speech-models-on-qianwen-ai-platform

Alibaba ra mắt chuỗi mô hình giọng nói Qwen-Audio-3.0 trên nền tảng AI Qianwen

Alibaba Cloud đã chính thức ra mắt chuỗi mô hình giọng nói Qwen-Audio-3.0 trên nền tảng Qianwen AI và Bailian, cho phép truy cập thông qua API và gói Token Plan. Chuỗi mô hình này bao gồm ba phiên bản: Qwen-Audio-3.0-ASR (nhận dạng giọng nói), Qwen-Audio-3.0-TTS (tổng hợp giọng nói) và Qwen-Audio-3.0-Realtime (tương tác giọng nói thời gian thực). Chuỗi mô hình Qwen-Audio-3.0 đã đạt vị trí dẫn đầu toàn cầu trong các danh mục ASR, RealTime và TTS trên bảng xếp hạng Artificial Analysis, đánh dấu một bước tiến lớn trong lĩnh vực AI giọng nói. Sự kiện này nâng cao năng lực cạnh tranh của Alibaba trong các hệ thống đối thoại giọng nói dạng đầu-cuối (end-to-end), vốn rất quan trọng để tạo ra tương tác tự nhiên và độ trễ thấp giữa người và AI. Qwen-Audio-3.0-Realtime hỗ trợ hiểu và đối thoại giọng nói dạng đầu-cuối, cho phép người dùng ngắt lời và đặt câu hỏi tiếp nối, đồng thời hỗ trợ gọi công cụ (tool calling). Trong khi đó, mô hình TTS cho phép kiểm soát cảm xúc, giọng điệu và nhịp điệu, còn mô hình ASR được tối ưu hóa cho các bối cảnh phức tạp và lĩnh vực chuyên môn.

## KIẾN THỨC NỀN

Các trợ lý ảo truyền thống dựa trên một quy trình tuần tự (cascaded): chuyển giọng nói thành văn bản (ASR), xử lý bằng mô hình ngôn ngữ lớn, và chuyển văn bản phản hồi ngược lại thành giọng nói (TTS). Ngược lại, các hệ thống đối thoại giọng nói đầu-cuối (end-to-end) hiện đại ánh xạ trực tiếp đầu vào giọng nói thành đầu ra giọng nói, giúp giảm đáng kể độ trễ và giữ lại các tín hiệu phi ngôn ngữ như cảm xúc. Artificial Analysis là một nền tảng đánh giá độc lập chuyên đo lường các mô hình AI về hiệu suất, chất lượng và chi phí.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#Speech Recognition#Text-to-Speech#Large Language Models#Alibaba Qwen

$ subscribe --daily

Alibaba ra mắt chuỗi mô hình giọng nói Qwen-Audio-3.0 trên nền tảng AI Qianwen | Daily News