~/EMBODIED AI/agibot-s-wita-omni-preview-tops-dailyomni-embodied-multimodal-benchmark

Mô hình WITA-Omni Preview của AGIBOT dẫn đầu bảng xếp hạng DailyOmni

Mô hình đa phương thức gốc tích hợp (embodied native multimodal model) tự phát triển của AGIBOT, WITA-Omni Preview, đã dẫn đầu bảng xếp hạng DailyOmni với điểm số 85,21. Mô hình này đã vượt qua các đối thủ hàng đầu từ Qwen, Gemini, Doubao và NVIDIA, đồng thời đứng đầu ở 6 trên 8 chỉ số phụ. Mô hình này giới thiệu kiến trúc "Thinker-Talker-Actor" (Người nghĩ - Người nói - Người hành động), nâng tầm các hành động vật lý và biểu cảm khuôn mặt thành các đầu ra chính cùng với giọng nói. Cách tiếp cận đầu-cuối (end-to-end) thống nhất này cho phép robot nhân hình tích hợp liền mạch giữa nhận thức, ra quyết định và thực thi vật lý trong môi trường thực tế. WITA-Omni Preview được huấn luyện trên hàng chục triệu giờ dữ liệu đa phương thức bằng hệ thống dữ liệu phân tầng. Để giải quyết tình trạng thiếu dữ liệu tương tác trong các tập dữ liệu công khai, AGIBOT đã xây dựng một tập dữ liệu chất lượng cao nhằm bảo toàn mối quan hệ thời gian tự nhiên giữa âm thanh, hình ảnh, ngôn ngữ, hành động và biểu cảm.

## KIẾN THỨC NỀN

Bảng xếp hạng DailyOmni đánh giá khả năng lập luận chéo đa phương thức đồng bộ và căn chỉnh thời gian của mô hình bằng các kịch bản âm thanh-hình ảnh thực tế. Các kiến trúc đa phương thức truyền thống thường sử dụng mô hình "Thinker-Talker", giúp tách biệt quá trình lập luận và tạo giọng nói, nhưng thiếu sự tích hợp trực tiếp các hành động vật lý cần thiết cho AI tương tác vật lý (embodied AI).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Embodied AI#Multimodal LLMs#Robotics#AGIBOT

$ subscribe --daily

Mô hình WITA-Omni Preview của AGIBOT dẫn đầu bảng xếp hạng DailyOmni | Daily News