~/SPEECH RECOG/alibaba-launches-qwen-audio-3-0-asr-flash-for-enhanced-industry-specific

Alibaba Ra Mắt Qwen-Audio-3.0-ASR-Flash Giúp Nhận Dạng Từ Vựng Chuyên Ngành Tốt Hơn

Alibaba đã ra mắt Qwen-Audio-3.0-ASR-Flash, một mô hình nhận dạng giọng nói được tối ưu hóa về tính nhất quán của ngữ cảnh, thuật ngữ chuyên ngành và khả năng tùy chỉnh từ khóa nóng (hotword). Mô hình này hiện có sẵn trên nền tảng Alibaba Cloud Bailian với ba phiên bản, bao gồm chuyển biên tập tin ngoại tuyến và nhận dạng giọng nói trực tuyến theo thời gian thực. Bản cập nhật này giải quyết một hạn chế phổ biến trong các hệ thống chuyển giọng nói thành văn bản bằng cách cải thiện đáng kể khả năng nhận dạng các thuật ngữ hiếm và chuyên ngành, đạt tỷ lệ chính xác 95,36% trong các kịch bản y tế. Mô hình này cũng đứng đầu trên bảng xếp hạng Artificial Analysis với tỷ lệ lỗi ký tự thấp chỉ 1,7%, giúp nó có tính ứng dụng cao cho các doanh nghiệp trong việc ghi biên bản cuộc họp và chăm sóc khách hàng. Mô hình này có khả năng tinh chỉnh giọng nói để trực tiếp xuất ra văn bản có cấu trúc và hỗ trợ đầu vào âm thanh lên đến 5 phút đối với phiên bản Flash. Quá trình huấn luyện bao gồm việc xây dựng một cơ sở dữ liệu từ vựng chất lượng cao bao gồm các lĩnh vực như y tế, lập trình CNTT, tài chính và tên người nổi tiếng.

## KIẾN THỨC NỀN

Các hệ thống nhận dạng giọng nói tự động (ASR) thường gặp khó khăn với các thuật ngữ chuyên ngành, từ viết tắt hoặc tên riêng ít phổ biến, vấn đề này thường được giải quyết bằng cách sử dụng tính năng "tùy chỉnh từ khóa nóng" (hotword customization) để định hướng mô hình nhận diện các từ cụ thể. Nền tảng Bailian của Alibaba Cloud (còn gọi là Model Studio) là một nền tảng phát triển toàn diện cho phép người dùng truy cập, tinh chỉnh và triển khai các mô hình nền tảng khác nhau như dòng Qwen.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Speech Recognition#AI Models#Alibaba Qwen#ASR

$ subscribe --daily

Alibaba Ra Mắt Qwen-Audio-3.0-ASR-Flash Giúp Nhận Dạng Từ Vựng Chuyên Ngành Tốt Hơn | Daily News