OpenAI ra mắt hai mô hình chuyển âm GPT-Live-Transcribe và GPT-Transcribe qua API
OpenAI đã ra mắt hai mô hình chuyển đổi giọng nói thành văn bản mới qua API: GPT-Live-Transcribe, được thiết kế để chuyển âm trực tiếp với độ trễ thấp, và GPT-Transcribe, được tối ưu hóa cho xử lý hàng loạt không đồng bộ. Các mô hình này mang lại khả năng nhận biết ngữ cảnh tốt hơn và xử lý hiệu quả hơn các yếu tố như giọng vùng miền, tiếng ồn và thuật ngữ chuyên ngành. Các mô hình này giúp giảm đáng kể tỷ lệ lỗi so với mô hình Whisper trước đây của OpenAI, mang lại cho các nhà phát triển những lựa chọn chính xác và tiết kiệm chi phí hơn để xây dựng các ứng dụng hỗ trợ giọng nói. GPT-Live-Transcribe có giá 0,017 USD mỗi phút, trong khi GPT-Transcribe có giá 0,0045 USD mỗi phút. Trong các bài kiểm tra hiệu năng, GPT-Transcribe đạt tỷ lệ lỗi 19,27% trên Common Voice với 22 ngôn ngữ, so với mức 40,37% của Whisper.
## KIẾN THỨC NỀN
Hệ thống nhận dạng giọng nói tự động (ASR) chuyển đổi âm thanh tiếng nói thành văn bản viết. Công nghệ ASR nhận biết ngữ cảnh (Context-aware ASR) cải thiện quá trình này bằng cách sử dụng văn bản xung quanh, gợi ý hoặc siêu dữ liệu để định hướng mô hình chuyển âm chính xác các từ hiếm gặp, danh từ riêng và thuật ngữ chuyên ngành.