inclusionAI ra mắt mô hình MoE đa thức Ling-3.0-flash-VL với ngữ cảnh 1 triệu token
inclusionAI đã phát hành Ling-3.0-flash-VL, một mô hình Mixture-of-Experts (MoE) đa thức mở có tổng cộng 124 tỷ tham số nhưng chỉ kích hoạt 5,5 tỷ tham số cho mỗi token. Mô hình mở rộng khả năng suy luận ngôn ngữ sang xử lý hình ảnh và video nguyên bản trong cửa sổ ngữ cảnh lên tới 1 triệu token. Bằng cách kết hợp dung lượng tham số lớn với kích hoạt thưa và khả năng suy luận hình ảnh-ngôn ngữ trong ngữ cảnh dài, mô hình cho phép xử lý hiệu quả các đoạn video dài và các quy trình tác vụ thông minh phức tạp. Kiến trúc này chứng minh các cơ chế chú ý lai có thể giảm đáng kể chi phí bộ nhớ trong khi vẫn duy trì hiệu năng đa thức hàng đầu. Kiến trúc tích hợp một bộ mã hóa thị giác ViT cùng bộ chiếu MLP 2 lớp, VideoRoPE để mã hóa không gian-thời gian, và khung xương 42 lớp luân phiên giữa các lớp KDA và Gated MLA theo tỷ lệ 5:1. Thiết kế mới này hỗ trợ xác định vị trí sự kiện chi tiết, trả lời câu hỏi trên video dài và chỉnh sửa clip với hiệu suất truy xuất cao.
## KIẾN THỨC NỀN
Các mô hình Mixture-of-Experts (MoE) sử dụng các mạng con chuyên biệt để xử lý dữ liệu đầu vào, điều hướng các token đến các chuyên gia cụ thể nhằm giữ chi phí tính toán thấp dù dung lượng tham số tổng thể rất lớn. KDA (Kimi Delta Attention) và Gated MLA (Multi-Latent Attention) là các cơ chế chú ý tuyến tính và hạng thấp giúp giảm mạnh mức tiêu thụ bộ nhớ và nghẽn bộ đệm KV trong các chuỗi dài. VideoRoPE điều chỉnh mã hóa vị trí quay (rotary position embeddings) cho dữ liệu video 3D bằng cách mô hình hóa rõ ràng cả thứ tự thời gian lẫn tọa độ không gian.