OpenAI công bố GPT-Live với kiến trúc giọng nói song công toàn phần
OpenAI đã giới thiệu GPT-Live, một ngăn xếp giọng nói được tái cấu trúc hoàn toàn từ máy khách đến mô hình để hỗ trợ giao tiếp song công toàn phần (full-duplex), cho phép AI vừa nghe vừa nói cùng một lúc. Kiến trúc mới này giữ cho luồng âm thanh hoạt động liên tục ngay cả khi mô hình đang thực hiện suy luận sâu hơn hoặc sử dụng công cụ. Bản cập nhật này chuyển đổi tương tác giọng nói của AI từ mô hình luân phiên lượt nói cứng nhắc sang một cuộc hội thoại trôi chảy mô phỏng gần gũi với giao tiếp thực tế của con người. Nó giảm đáng kể độ trễ và cho phép người dùng ngắt lời AI hoặc nhận phản hồi đệm theo thời gian thực như "mhmm" hoặc "yeah". Để đạt được điều này, OpenAI định tuyến âm thanh qua một đường truyền nhanh chuyên dụng trong khi quá trình suy luận và sử dụng công cụ diễn ra bất đồng bộ. Ngoài ra, họ đã giảm quy trình khởi động phiên thoại từ sáu lượt truyền mạng xuống chỉ còn một lượt, sử dụng các mô hình GPT-Live-1 và GPT-Live-1 mini mới.
## KIẾN THỨC NỀN
Các trợ lý giọng nói truyền thống hoạt động trên mô hình luân phiên lượt nói, trong đó người dùng nói, hệ thống xử lý âm thanh rồi mới phản hồi. Giao tiếp song công toàn phần (full-duplex) cho phép truyền dữ liệu đồng thời theo cả hai hướng, giúp thực hiện các phản hồi ngắt lời theo thời gian thực và tạo ra động lực trò chuyện tự nhiên hơn.