Microsoft Ra Mắt MAI-Transcribe-2-Streaming Với Độ Trễ 0,13 Giây Và Tỷ Lệ Lỗi Từ 2,5%
Microsoft đã chính thức ra mắt MAI-Transcribe-2-Streaming, mô hình AI chuyển đổi giọng nói thành văn bản theo thời gian thực hỗ trợ 60 ngôn ngữ cùng khả năng liên tục tự động nhận diện ngôn ngữ. Trên bảng xếp hạng Artificial Analysis, mô hình này đứng đầu trong số 28 mô hình phát trực tuyến với tỷ lệ lỗi từ (WER) 2,5% và độ trễ 0,13 giây. Khả năng nhận dạng giọng nói theo thời gian thực với độ trễ cực thấp giúp các trợ lý giọng nói tương tác và hệ thống phụ đề trực tiếp xử lý ý định của người dùng ngay cả khi họ chưa nói xong câu. Việc đạt hiệu suất dẫn đầu về cả độ trễ lẫn độ chính xác sẽ thiết lập một chuẩn mực mới trong ngành cho các ứng dụng âm thanh AI thời gian thực. Mô hình tạo ra kết quả văn bản tạm thời đầu tiên chỉ khoảng 100 miligiây sau khi nhận âm thanh và liên tục điều chỉnh theo ngữ cảnh cho đến khi chốt kết quả cuối cùng. Chi phí sử dụng hiện tại là 0,54 USD mỗi giờ (khoảng 9 USD cho 1.000 phút) và có thể truy cập qua Microsoft Foundry, MAI Playground cùng OpenRouter.
## KIẾN THỨC NỀN
Tỷ lệ lỗi từ (Word Error Rate - WER) là thước đo tiêu chuẩn để đánh giá các hệ thống nhận dạng giọng nói, trong đó tỷ lệ phần trăm càng thấp thể hiện độ chính xác càng cao. Khác với chuyển tự theo lô truyền thống xử lý các tệp âm thanh đã hoàn tất, nhận dạng giọng nói phát trực tuyến trả về văn bản liên tục khi đang nói, khiến độ trễ thấp trở thành yếu tố quyết định cho các cuộc đối thoại trực tiếp.