~/MULTIMODAL A/bytedance-launches-seedrealtime-a-native-audio-video-full-duplex-ai-model

ByteDance ra mắt SeedRealtime, mô hình AI song công toàn phần âm thanh - video gốc

Nhóm Seed của ByteDance đã ra mắt SeedRealtime, một mô hình lớn song công toàn phần (full-duplex) tích hợp gốc âm thanh, video và văn bản vào một kiến trúc thống nhất. Mô hình này cho phép tương tác đa phương thức theo thời gian thực và hiện đã được triển khai toàn diện trên ứng dụng Doubao. Sự kiện này đánh dấu bước chuyển dịch từ tương tác AI theo lượt truyền thống sang giao tiếp tự nhiên, đồng thời "nhìn, nghe và nói". Bằng cách triển khai trực tiếp công nghệ này trên ứng dụng Doubao, ByteDance đã tạo nên một cột mốc quan trọng trong việc ứng dụng thực tế tương tác người-máy theo thời gian thực. SeedRealtime giảm một nửa các vấn đề về nhịp điệu hội thoại so với các mô hình phân tầng (cascade) truyền thống, giúp cải thiện đáng kể luồng đối thoại và giảm thiểu tình trạng bị ngắt quãng. Người dùng có thể trải nghiệm tính năng này bằng cách cập nhật ứng dụng Doubao và chọn tùy chọn gọi video.

## KIẾN THỨC NỀN

Các trợ lý ảo truyền thống thường sử dụng kiến trúc phân tầng (cascade) liên kết các mô hình chuyển giọng nói thành văn bản, xử lý ngôn ngữ và chuyển văn bản thành giọng nói riêng biệt, dẫn đến độ trễ và tương tác theo lượt. Ngược lại, các mô hình song công toàn phần (full-duplex) cho phép giao tiếp hai chiều liên tục và đồng thời, tương tự như cuộc trò chuyện tự nhiên của con người. Nhóm Seed của ByteDance, được thành lập vào năm 2023, tập trung vào nghiên cứu trí tuệ nhân tạo tổng quát bao gồm AI đa phương thức và các tương tác thế hệ mới.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#Large Language Models#Human-Computer Interaction#ByteDance

$ subscribe --daily

ByteDance ra mắt SeedRealtime, mô hình AI song công toàn phần âm thanh - video gốc | Daily News