Microsoft Ra Mắt Mage-VL: Mô Hình Đa Phương Thức Truyền Phát Hiệu Quả Dựa Trên Codec
Microsoft đã phát hành Mage-VL, một mô hình nền tảng đa phương thức 4 tỷ tham số tận dụng các nguyên lý của bộ giải mã video (codec) để xử lý video truyền phát trực tiếp. Bằng cách chỉ tập trung vào các vùng có chuyển động và chi tiết mới (khung hình P) bên cạnh các khung hình neo (khung hình I), mô hình giúp giảm hơn 75% lượng token hình ảnh và tăng tốc độ suy luận lên tới 3,5 lần. Các mô hình ngôn ngữ lớn xử lý video truyền thống thường rất tốn tài nguyên và chậm khi truyền phát thời gian thực do phải xử lý lưới dày đặc các khung hình đồng đều. Mage-VL giải quyết nút thắt cổ chai này, cho phép hiểu video thời gian thực với độ trễ thấp và đưa ra bình luận dựa trên sự kiện một cách hiệu quả trên phần cứng thông thường. Mô hình kết hợp bộ mã hóa hình ảnh được huấn luyện từ đầu (Mage-ViT) với bộ giải mã ngôn ngữ Qwen3-4B, sử dụng thiết kế quy trình kép "Hệ thống 1 & Hệ thống 2", trong đó một cổng nhận thức nhẹ sẽ lọc bỏ các nội dung thông thường trước khi kích hoạt toàn bộ mô hình VLM. Hệ thống này không phụ thuộc vào loại codec cụ thể, hỗ trợ cả các codec truyền thống như H.264, HEVC lẫn các codec mạng nơ-ron như DCVC-RT mà không cần thay đổi kiến trúc.
## KIẾN THỨC NỀN
Các bộ giải mã nén video (codec) tiết kiệm băng thông bằng cách sử dụng khung hình I (hình ảnh hoàn chỉnh) và khung hình P (chỉ ghi lại các thay đổi hoặc chuyển động so với khung hình trước đó). Các mô hình Vision Transformer (ViT) thường xử lý hình ảnh bằng cách chia chúng thành một lưới các mảnh nhỏ (patch), nhưng việc áp dụng đồng đều phương pháp này cho mọi khung hình trong một luồng video sẽ tạo ra lượng token khổng lồ khiến các mô hình AI khó xử lý kịp thời.