~/SPEECH RECOG/microsoft-releases-open-source-vibevoice-asr-streaming-model

Microsoft phát hành mô hình nguồn mở VibeVoice-ASR-Streaming

Microsoft đã phát hành VibeVoice-ASR-Streaming, một mô hình nguồn mở được thiết kế cho việc nhận dạng giọng nói phát trực tuyến theo thời gian thực với độ trễ thấp. Mô hình này được cung cấp như một phần của khuôn khổ VibeVoice của Microsoft trên GitHub và Hugging Face. Nhận dạng giọng nói phát trực tuyến theo thời gian thực là công nghệ thiết yếu cho các ứng dụng tạo phụ đề trực tiếp, trợ lý giọng nói tương tác và ghi âm tức thì. Bằng cách mở mã nguồn mô hình này, Microsoft cho phép các nhà phát triển triển khai xử lý giọng nói tiên tiến cục bộ mà không cần phụ thuộc vào các dịch vụ API độc quyền trả phí. Khuôn khổ VibeVoice bao gồm cả các mô hình nghiên cứu Nhận dạng tiếng nói tự động (ASR) và Chuyển văn bản thành giọng nói (TTS). Khác với các mô hình ASR xử lý theo lô thông thường, biến thể phát trực tuyến xử lý các đầu vào âm thanh liên tục theo từng đoạn ngắn để đưa ra đầu ra văn bản tức thì.

## KIẾN THỨC NỀN

Nhận dạng tiếng nói tự động (ASR) chuyển đổi âm thanh giọng nói thành văn bản. Các mô hình ASR truyền thống thường chuyển phiên mã toàn bộ tệp âm thanh đã ghi âm, trong khi ASR phát trực tuyến (streaming) xử lý liên tục các đoạn âm thanh nhỏ (thường có độ dài 100-200 mili giây), cho phép chuyển đổi giọng nói thành văn bản ngay lập tức cho các luồng âm thanh trực tiếp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#speech-recognition#audio-processing#microsoft#machine-learning#open-source-ai

$ subscribe --daily

Microsoft phát hành mô hình nguồn mở VibeVoice-ASR-Streaming | Daily News