~/LLMS/integration-status-of-ling-3-0-flash-weights-across-major-inference-engines

Trạng thái tích hợp trọng số Ling-3.0-flash trên các công cụ suy luận chính

Mô hình Ling-3.0-flash sắp ra mắt, sử dụng cơ chế chú ý lai KDA và MLA, đang có sự chuẩn bị tích hợp khác nhau giữa các công cụ suy luận LLM lớn. SGLang đã cam kết hỗ trợ ngay từ ngày đầu (day-0), vLLM dự kiến hỗ trợ khi trọng số được mở nguồn, trong khi llama.cpp hiện thiếu đường dẫn chuyển đổi cho kiến trúc Bailing MoE của mô hình này. Điều này làm nổi bật những thách thức trong việc phối hợp giữa các nhà phát triển mô hình và các khung suy luận mã nguồn mở trong các đợt phát hành theo kiểu "công bố trước, mở khóa trọng số sau". Nó cũng cho thấy các kiến trúc chuyên biệt như Bailing MoE có thể gặp sự chậm trễ trên các công cụ triển khai cục bộ như llama.cpp do thiếu các đóng góp chuyển đổi từ cộng đồng. Mặc dù llama.cpp đã hỗ trợ các nhân (kernel) KDA được sử dụng trong Ling-3.0-flash, rào cản chính đối với việc hỗ trợ định dạng GGUF là đường dẫn chuyển đổi Bailing MoE, vốn vẫn chưa được triển khai sau khi các yêu cầu trước đó cho phiên bản 2.6 bị đóng. Việc phát hành mã nguồn mở cho các trọng số dự kiến sẽ diễn ra sau khi thời gian truy cập API miễn phí của mô hình kết thúc vào ngày 3 tháng 8.

## KIẾN THỨC NỀN

SGLang và vLLM là các khung phục vụ hiệu năng cao được thiết kế để triển khai LLM một cách hiệu quả. Ling-3.0-flash sử dụng cơ chế chú ý lai kết hợp Kimi Delta Attention (KDA) - một mô-đun chú ý tuyến tính hiệu quả về phần cứng, và Multi-Head Latent Attention (MLA) - cơ chế nén bộ nhớ đệm KV để giảm mức tiêu thụ bộ nhớ. Mixture of Experts (MoE) là kiến trúc chỉ kích hoạt một phần nhỏ các tham số của mô hình cho mỗi token, và Bailing MoE là biến thể cụ thể được sử dụng bởi các mô hình Ling của Ant Group.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#Inference Engines#vLLM#SGLang#Open Source AI

$ subscribe --daily

Trạng thái tích hợp trọng số Ling-3.0-flash trên các công cụ suy luận chính | Daily News