InclusionAI Ra Mắt Realtime-Venus: Mô Hình AI Đa Phương Thức 9B Song Công Mở Chạy Thời Gian Thực
InclusionAI đã phát hành Realtime-Venus, một hệ thống AI đa phương thức mã nguồn mở 9B tham số phát triển từ MiniCPM-o 4.5, hỗ trợ cảm nhận âm thanh - hình ảnh liên tục, phát luồng văn bản/tiếng nói và tương tác chủ động. Dự án cung cấp hai phiên bản checkpoint: Realtime-Venus-Omni cho khả năng kết hợp cả âm thanh lẫn hình ảnh và Realtime-Venus-Audio dành cho xử lý dòng âm thanh. Phát hành này thúc đẩy lĩnh vực AI đa phương thức mã nguồn mở bằng cách cung cấp các mô hình giao tiếp song công (full-duplex) thực sự, có khả năng nghe, nhìn và nói đồng thời cũng như chủ động phản hồi mà không cần chờ câu lệnh từ người dùng. Điều này đưa hệ sinh thái mã nguồn mở tiến gần hơn đến các trợ lý giống con người, có thể xử lý việc ngắt lời, phản hồi đệm và ủy quyền tác vụ bất đồng bộ theo thời gian thực. Realtime-Venus tích hợp khả năng xử lý ngắt lời theo ngữ nghĩa, truy xuất bộ nhớ video dài không cần huấn luyện bổ sung và cú pháp yêu cầu `<delegate>` trong luồng để chuyển tác vụ tới môi trường thực thi nền mà không làm dừng cuộc nói chuyện. Quá trình tổng hợp tiếng nói sử dụng các tài nguyên Token2wav đi kèm hỗ trợ giọng mẫu tham chiếu, được điều phối thông qua kho lưu trữ Realtime-Venus-Harness.
## KIẾN THỨC NỀN
AI giao tiếp song công (full-duplex) cho phép tương tác hai chiều đồng thời, giúp mô hình liên tục xử lý đầu vào hình ảnh và âm thanh ngay trong khi đang nói thay vì phải chờ đến lượt của người dùng. Realtime-Venus được phát triển dựa trên kiến trúc MiniCPM-o của OpenBMB, một mô hình đa phương thức 9B tham số đầu-cuối kết hợp thị giác (SigLip), nhận dạng tiếng nói (Whisper) và các thành phần tổng hợp giọng nói.