Simon Willison ra mắt giao diện web cho API Gemini Live của Google
Nhà phát triển Simon Willison đã phát hành một giao diện web mã nguồn mở cho phép trò chuyện bằng giọng nói thời gian thực hai chiều với các mô hình Gemini 3.8 Live mới ra mắt của Google trực tiếp trên trình duyệt. Công cụ này cho phép người dùng chọn giọng nói, thiết lập chỉ dẫn hệ thống và ngắt lời mô hình AI khi đang nói. Bằng cách cung cấp một ứng dụng web nhẹ không cần thư viện ngoài, công cụ này giúp các nhà phát triển dễ dàng thử nghiệm khả năng đa thức thời gian thực của Google mà không cần thiết lập máy chủ phụ trợ. Nó cũng là một ví dụ tham khảo thực tế để xây dựng các trợ lý giọng nói tương tác độ trễ thấp. Bản triển khai HTML hoàn toàn dựa vào các công nghệ trình duyệt nguyên bản, kết nối trực tiếp với điểm cuối WebSocket hai chiều của Google Generative AI (`BidiGenerateContent`) và sử dụng `AudioContext` của Web Audio API để thu và phát luồng âm thanh.
## KIẾN THỨC NỀN
API Gemini Live của Google cho phép tương tác bằng giọng nói độ trễ thấp nhờ xử lý liên tục luồng âm thanh qua kết nối WebSocket thay vì gọi HTTP dạng văn bản truyền thống. Mô hình AI speech-to-speech trực tiếp hiểu và tạo ra âm thanh, mang lại trải nghiệm trò chuyện tự nhiên, liền mạch với sắc thái giọng nói giống con người.