OpenAI ra mắt API GPT-Live-1 cho agent giọng nói song công thời gian thực
OpenAI đã chính thức phát hành mô hình GPT-Live-1 qua API, cho phép các nhà phát triển xây dựng ứng dụng giọng nói thời gian thực song công hỗ trợ xử lý ngắt lời, gọi công cụ (tool calling) và tích hợp điện thoại. Mô hình hợp nhất này kết hợp khả năng hiểu và phát giọng nói trực tiếp, thay thế cho quy trình nhiều bước truyền thống. Nhờ loại bỏ các bước tách biệt gồm Chuyển giọng nói thành văn bản (STT), xử lý LLM và Chuyển văn bản thành giọng nói (TTS), GPT-Live-1 giảm đáng kể độ trễ tương tác giọng nói và độ phức tạp kiến trúc hệ thống. Các đơn vị thử nghiệm sớm báo cáo đã giảm tới 80% dung lượng mã nguồn và giảm gần 80% số lần bị ngắt lời nhầm khi người dùng dừng lại suy nghĩ. Chi phí cho lớp giọng nói đầu vào/đầu ra được ấn định ở mức 0,05 USD/phút (khoảng 3 USD/giờ), chưa bao gồm chi phí cho mô hình backend và công cụ. Mô hình đạt điểm cao hơn 30 điểm phần trăm so với GPT-Realtime-2.1 trên Full Duplex Bench, đứng đầu trong các nhiệm vụ agent Tau3 khi kết hợp với GPT-6 Astra, đồng thời bổ sung 12 tùy chọn giọng nói mới và tính năng định hướng từ khóa (keyword biasing).
## KIẾN THỨC NỀN
Các ứng dụng AI giọng nói truyền thống phụ thuộc vào chuỗi hệ thống nối tiếp gồm nhận dạng giọng nói (ASR), mô hình ngôn ngữ lớn dạng văn bản (LLM) và tổng hợp giọng nói (TTS), gây ra độ trễ đáng kể và sự tương tác chưa tự nhiên. Các mô hình giọng nói sang giọng nói trực tiếp (native speech-to-speech) hợp nhất khả năng cảm nhận và phát âm thanh, cho phép giao tiếp song công (full-duplex) nơi hai bên có thể nghe và ngắt lời nhau đồng thời mà vẫn giữ được sắc thái âm điệu.