Alibaba ra mắt CosyVoice Studio, nền tảng năng suất giọng nói AI
Alibaba đã ra mắt CosyVoice Studio, một nền tảng năng suất giọng nói tích hợp AI dựa trên mô hình tự phát triển Qwen-Audio. Nền tảng này cung cấp các tính năng ghi âm chuyển ngữ thông minh (CosyFlow), trợ lý giọng nói thời gian thực (CosyAgent) và công cụ sáng tạo nội dung âm thanh (CosyCreative). Sự kiện này đánh dấu ứng dụng thực tiễn từ các mô hình AI âm thanh của Alibaba, giúp người dùng phổ thông và doanh nghiệp dễ dàng tiếp cận công nghệ tổng hợp giọng nói, chuyển ngữ và tạo trợ lý ảo tiên tiến. Điều này làm tăng tính cạnh tranh trong lĩnh vực công cụ năng suất giọng nói AI, đối đầu trực tiếp với các công cụ chuyển ngữ và chuyển văn bản thành giọng nói hiện có. Trong khi công cụ ghi âm chuyển ngữ cơ bản CosyFlow hiện đang được trải nghiệm miễn phí có giới hạn thời gian trên các nền tảng lớn, các tính năng nâng cao như CosyAgent và CosyCreative ban đầu chỉ giới hạn cho người dùng doanh nghiệp thông qua hệ thống lời mời danh sách chờ (whitelist).
## KIẾN THỨC NỀN
Qwen-Audio là mô hình ngôn ngữ âm thanh lớn của Alibaba có khả năng hiểu nhiều loại đầu vào âm thanh khác nhau như giọng nói con người, âm nhạc và âm thanh tự nhiên. CosyVoice là mô hình tạo giọng nói đa ngôn ngữ tiên tiến do Alibaba phát triển nhằm phục vụ việc tổng hợp văn bản thành giọng nói (TTS) và sao chép giọng nói với độ chân thực cao.