SpaceXAI ra mắt Grok Voice Transcribe 2.0 với tỷ lệ lỗi giảm một nửa
SpaceXAI đã ra mắt mô hình chuyển đổi giọng nói thành văn bản Grok Voice Transcribe 2.0, giảm gần một nửa tỷ lệ lỗi từ so với phiên bản tiền nhiệm trong khi vẫn giữ nguyên mức giá. Mô hình này vươn lên dẫn đầu về độ chính xác trong số 32 mô hình nhận dạng giọng nói trực tiếp (streaming) trên bảng xếp hạng Artificial Analysis. Bằng cách mang lại bước tiến lớn về chất lượng chuyển đổi giọng nói mà không tăng chi phí, SpaceXAI giảm bớt rào cản triển khai AI giọng nói độ chính xác cao cho tổng đài chăm sóc khách hàng, ghi chép truyền thông và các nền tảng xe hơi. Sự cải thiện về hiệu năng trên chi phí này tạo áp lực lên các nhà cung cấp AI giọng nói đối thủ và thúc đẩy việc áp dụng các giao diện giọng nói thời gian thực. Giá dịch vụ chuyển đổi theo lô (batch) giữ nguyên ở mức 0,10 USD mỗi giờ âm thanh, trong khi chuyển đổi trực tiếp thời gian thực (streaming) có giá 0,20 USD mỗi giờ. Các tính năng nâng cao như phân biệt người nói (speaker diarization), mốc thời gian chính xác và từ khóa tùy chỉnh đều được tích hợp sẵn mà không tốn thêm phí.
## KIẾN THỨC NỀN
Công nghệ Nhận dạng Giọng nói Tự động (ASR) chuyển đổi âm thanh nói thành văn bản chữ viết, thường được đánh giá qua Tỷ lệ Lỗi Từ (WER) để đo lường độ chính xác. Khác với xử lý theo lô đối với các tệp ghi âm sẵn, nhận dạng giọng nói phát trực tiếp (streaming) xử lý âm thanh theo thời gian thực, cho phép xuất văn bản tức thì cho các ứng dụng tương tác như trợ lý trên xe hơi và hỗ trợ trực tuyến.