Alibaba ra mắt mô hình toàn mô thức Qwen3.8-Omni-Flash hỗ trợ ngữ cảnh 1 triệu token
Alibaba đã chính thức ra mắt Qwen3.8-Omni-Flash, một mô hình AI toàn mô thức (omnimodal) nguyên bản có khả năng xử lý văn bản, hình ảnh, âm thanh và video trong cửa sổ ngữ cảnh 1 triệu token. Trải qua 30 bài kiểm thử benchmark, mô hình mới đạt mức tăng điểm trung bình hơn 26% so với Qwen3.5-Omni-Plus, đồng thời giảm hơn 90% chi phí API cho đầu vào âm thanh và video. Mô hình mang lại khả năng hiểu đa mô thức hiệu suất cao—bao gồm cảm nhận âm thanh không gian theo thời gian thực và xử lý hậu kỳ âm thanh-video phức tạp—cho các ứng dụng doanh nghiệp với chi phí suy luận giảm đáng kể. Bằng cách đạt hiệu suất tương đương hoặc vượt trội so với Gemini 3.8 Flash ở các tác vụ âm thanh và đại lý (agent), đồng thời giảm 45,7% lượng token tiêu thụ, mô hình đã thiết lập một tiêu chuẩn mới về hiệu quả cho AI toàn mô thức thời gian thực. Qwen3.8-Omni-Flash giới thiệu phiên bản Realtime hỗ trợ định vị âm thanh không gian nhằm xác định hướng và khoảng cách của nguồn âm kết hợp với luồng video. Ngoài ra, Alibaba đã mở mã nguồn khung Qwen-Live Harness cho tương tác phát trực tiếp đa mô thức và mở rộng bộ Qwen-MM-Plugins với các công cụ như Video2Note giúp tạo ghi chú PDF từ video dài nhiều giờ.
## KIẾN THỨC NỀN
Các mô hình AI toàn mô thức (omnimodal) xử lý đồng thời nhiều dạng dữ liệu như văn bản, hình ảnh và giọng nói trong một mạng thần kinh thống nhất thay vì ghép nối các mô-đun riêng lẻ. Việc đánh giá các hệ thống này đòi hỏi các chỉ số đo lường chuyên dụng như cpWER (Concatenated Permutation Word Error Rate) cho nhận dạng giọng nói nhiều người, cùng các bộ benchmark đại lý phức tạp như AgenticVBench và WildClawBench-MM để đo lường khả năng thực thi tác vụ chuỗi dài.