Tích hợp Nemotron 3 Diarization để nhận diện người nói theo thời gian thực
Một nhà phát triển đã tích hợp mô hình Nemotron 3 Diarization của NVIDIA vào hệ thống giọng nói cục bộ để phân biệt người nói theo thời gian thực. Chạy trên máy DGX Spark kết nối với robot Reachy Mini, giải pháp phân tách luồng âm thanh theo các đoạn một giây để nhận diện từng người nói và tự động lưu nhớ tên của họ. Việc phân đoạn người nói theo thời gian thực từ lâu đã là rào cản lớn đối với các trợ lý giọng nói cục bộ và robot tương tác trong môi trường nhiều người. Thử nghiệm thành công này mở ra khả năng xây dựng các robot đồng hành phản hồi nhanh, bảo mật dữ liệu và duy trì ngữ cảnh hội thoại chính xác mà không phụ thuộc vào đám mây. Mô hình Nemotron 3 Diarization hỗ trợ theo dõi đồng thời tối đa tám người nói khác nhau và tích hợp sẵn với hệ sinh thái Hugging Face Transformers. Trong thử nghiệm này, việc xử lý âm thanh luồng một giây cho phép robot phát hiện người nói mới, chủ động hỏi tên và lưu danh tính cho các lượt hội thoại tiếp theo.
## KIẾN THỨC NỀN
Phân đoạn người nói (speaker diarization) là kỹ thuật xử lý âm thanh giúp xác định 'ai đã nói vào lúc nào' trong luồng hội thoại. Nemotron là dòng mô hình AI do NVIDIA phát triển, trong khi Reachy Mini là mô hình robot để bàn nguồn mở được thiết kế cho mục đích nghiên cứu AI và tương tác người - máy.