~/LLAMA CPP/llama-cpp-adds-support-for-ling-3-0-flash-vl-multimodal-moe

llama.cpp bổ sung hỗ trợ cho mô hình MoE đa thức Ling 3.0 Flash VL

Một yêu cầu kéo (pull request #29151) vào llama.cpp từ nhà phát triển aetherbird đã thêm hỗ trợ cho mô hình Ling 3.0 Flash VL. Đây là mô hình thị giác - ngôn ngữ hỗn hợp chuyên gia (MoE) thưa gồm 124 tỷ tham số, chỉ kích hoạt 5,5 tỷ tham số cho mỗi token và hỗ trợ cửa sổ ngữ cảnh lên tới 256K token. Việc đưa khả năng xử lý video và hình ảnh tự nhiên của Ling 3.0 Flash VL vào llama.cpp cho phép chạy cục bộ các mô hình đa thức lớn một cách hiệu quả trên phần cứng phổ thông. Điều này mở rộng khả năng mã nguồn mở cho các tác vụ phức tạp như phân tích video dài, suy luận thị giác và quy trình tác tử mà không cần phụ thuộc vào API đám mây. Kiến trúc mô hình sở hữu khung xương lai 42 lớp luân phiên giữa các lớp KDA và Gated MLA theo tỷ lệ 5:1, kết hợp cùng VideoRoPE để mã hóa không gian và thời gian trong video. Mô hình tích hợp đầu vào thị giác thông qua bộ mã hóa ViT kết hợp với chiếu MLP 2 lớp để đồng nhất biểu diễn hình ảnh và văn bản.

## KIẾN THỨC NỀN

Cơ chế chú ý ẩn đa đầu (MLA) và các biến thể như Gated MLA giúp nén dung lượng bộ nhớ đệm Key-Value (KV cache), mang lại hiệu quả bộ nhớ cao cho các tác vụ ngữ cảnh dài. Ngoài ra, VideoRoPE điều chỉnh nhúng vị trí quay (rotary position embedding) để xử lý đồng thời không gian 3D và thứ tự thời gian, giúp mô hình đa thức theo dõi chính xác các chuyển động liên tục trong các khung hình video.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#Multimodal#Vision-Language Models#MoE#Open Source AI

$ subscribe --daily

llama.cpp bổ sung hỗ trợ cho mô hình MoE đa thức Ling 3.0 Flash VL | Daily News