NVIDIA phát hành NemotronLabs-VoiceChat-11B hỗ trợ tương tác giọng nói song công toàn phần
NVIDIA đã phát hành mô hình NVIDIA-NemotronLabs-VoiceChat-11B trên Hugging Face, một mô hình 11 tỷ tham số được thiết kế cho tương tác giọng nói song công toàn phần (full-duplex). Mô hình này cho phép trải nghiệm AI đàm thoại bằng giọng nói tự nhiên và theo thời gian thực hơn. Việc phát hành này đại diện cho một bước tiến quan trọng đối với AI đa phương thức chạy cục bộ (local multimodal AI), cho phép các nhà phát triển xây dựng trợ lý giọng nói có thể nghe và nói đồng thời. Nó giúp chuyển đổi AI giọng nói từ kiểu tương tác đàm thoại bộ đàm trễ sang các cuộc hội thoại tự nhiên, trôi chảy như con người. Mô hình này được lưu trữ trên Hugging Face dưới dạng phát hành trọng số mở (open-weights), giúp người dùng dễ dàng tiếp cận để triển khai cục bộ và tùy chỉnh. Nó được thiết kế để xử lý các động lực hội thoại như ngắt lời và luân phiên lượt nói theo thời gian thực.
## KIẾN THỨC NỀN
Các hệ thống AI giọng nói truyền thống hoạt động ở chế độ bán song công (half-duplex), trong đó người dùng và AI phải thay phiên nhau nói, tương tự như sử dụng bộ đàm. Tương tác giọng nói song công toàn phần (full-duplex) cho phép AI nghe và xử lý âm thanh trong khi nói đồng thời, giúp nó xử lý các tình huống ngắt lời và phản hồi đệm một cách tự nhiên.