~/LLM/longcat-flash-lite-sparse-weights-released-with-1m-context-window

Phát hành trọng số LongCat-Flash-Lite-Sparse hỗ trợ ngữ cảnh 1 triệu token

Trọng số của mô hình LongCat-Flash-Lite-Sparse đã chính thức được phát hành, nâng cấp độ dài ngữ cảnh hỗ trợ gốc từ 256k lên 1 triệu token. Phiên bản này thay thế cơ chế chú ý Multi-head Latent Attention (MLA) đậm đặc bằng LongCat Sparse Attention (LSA). Bản phát hành này chứng minh ứng dụng thực tế của cơ chế chú ý thưa (sparse attention) để mở rộng cửa sổ ngữ cảnh một cách hiệu quả mà không gặp phải nghẽn cổ chai tính toán bậc hai của cơ chế chú ý tiêu chuẩn. Nó cung cấp cho các nhà nghiên cứu một mô hình mã nguồn mở để nghiên cứu các kiến trúc LLM ngữ cảnh dài. Bằng cách chuyển đổi từ MLA đậm đặc sang LSA, mô hình giảm quy mô tính toán xuống gần mức tuyến tính bằng cách chỉ chọn các token phù hợp nhất. Mô hình được xây dựng trên kiến trúc LongCat-Flash-Lite, mở rộng dung lượng ngữ cảnh lên gấp bốn lần.

## KIẾN THỨC NỀN

Các cơ chế chú ý tiêu chuẩn tăng quy mô theo hàm bậc hai với độ dài ngữ cảnh, khiến cho ngữ cảnh cực dài trở nên vô cùng tốn kém về mặt tính toán. Multi-head Latent Attention (MLA) nén KV cache để tiết kiệm bộ nhớ, trong khi LongCat Sparse Attention (LSA), được phát triển bởi Meituan như một bước tiến hóa của DeepSeek Sparse Attention, tối ưu hóa hơn nữa điều này bằng cách chọn lọc động các token liên quan để đạt được mức tăng trưởng gần như tuyến tính.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Sparse Attention#Long Context#Open Source AI

$ subscribe --daily

Phát hành trọng số LongCat-Flash-Lite-Sparse hỗ trợ ngữ cảnh 1 triệu token | Daily News