Phát hành các mô hình GGUF không kiểm duyệt gồm LongCat-Flash-Lite-Sparse ngữ cảnh 1M
Nhà phát triển LLMFan46 đã phát hành một bộ các mô hình GGUF không bị kiểm duyệt, nổi bật là LongCat-Flash-Lite-Sparse, một mô hình 69B-A3B sử dụng cơ chế sparse attention và hỗ trợ độ dài ngữ cảnh lên tới 1M. Bản phát hành này cũng bao gồm các phiên bản không kiểm duyệt của Qwen3.8-27B, Qwen3.5-122B-A10B, Qwen3-Coder-Next và Laguna-S2.1 tích hợp khả năng thị giác (vision). Bản phát hành này cung cấp cho cộng đồng AI mã nguồn mở các mô hình không kiểm duyệt có hiệu năng cao, hỗ trợ các tính năng tiên tiến như Multi-Token Prediction (MTP) và cửa sổ ngữ cảnh cực lớn. Điều này cho phép chạy cục bộ các mô hình quy mô lớn trên phần cứng tiêu dùng thông qua các định dạng lượng hóa như GGUF. Việc chạy mô hình LongCat-Flash-Lite-Sparse định dạng GGUF yêu cầu sử dụng nhánh rẽ (fork) llama.cpp tùy chỉnh của nhà phát triển, do nó chưa được hỗ trợ trong kho lưu trữ gốc (upstream). Các mô hình này vẫn bảo toàn tính năng Multi-Token Prediction (MTP) và Local Sparse Attention (LSA) gốc để duy trì tốc độ và chất lượng tạo văn bản.
## KIẾN THỨC NỀN
Multi-Token Prediction (MTP) là kỹ thuật giúp mô hình ngôn ngữ dự đoán đồng thời nhiều token tiếp theo nhằm tăng tốc độ suy luận. Cơ chế sparse attention, trái ngược với dense attention, giúp giảm độ phức tạp tính toán bằng cách chỉ tập trung vào một tập hợp con các token, điều này rất quan trọng để mở rộng cửa sổ ngữ cảnh lên tới 1 triệu token. GGUF là định dạng tệp phổ biến được thiết kế để tải và chạy nhanh các mô hình ngôn ngữ lớn (LLM) trên phần cứng cục bộ bằng các công cụ như llama.cpp.