~/LLAMA CPP/llama-cpp-adds-support-for-glm-5-3-flash-glm5-next-architecture

llama.cpp Bổ Sung Hỗ Trợ Cho Kiến Trúc Mô Hình GLM-5.3-Flash (GLM5-Next)

llama.cpp đã chính thức hợp nhất hỗ trợ (PR #27773) cho kiến trúc mô hình GLM-5.3-Flash (GLM5-Next). Thay đổi này cho phép người dùng chuyển đổi, định lượng (quantize) và chạy trực tiếp dòng mô hình GLM-5.3-Flash trên thiết bị cục bộ thông qua bộ máy suy luận llama.cpp. GLM-5.3-Flash giới thiệu cơ chế chú ý lai (hybrid attention) kết hợp cùng thiết kế Mixture-of-Experts thưa nhằm tối ưu hiệu suất cho các tác vụ ngữ cảnh dài và đại lý (agent). Việc đưa kiến trúc này lên llama.cpp giúp mở rộng hệ sinh thái các mô hình trọng số mở có thể chạy được trên phần cứng người dùng phổ thông. Kiến trúc GLM-5.3-Flash sử dụng phần sống Mixture-of-Experts với tổng cộng 320 tỷ tham số và 18 tỷ tham số kích hoạt cho mỗi token, kết hợp với Manifold-Constrained Hyper-Connections (mHC). PR này bổ sung các phép toán tensor và luồng thực thi đồ thị cần thiết để chạy các phiên bản GGUF đã được định lượng của dòng mô hình này.

## KIẾN THỨC NỀN

llama.cpp là một khung làm việc C/C++ phổ biến được thiết kế để suy luận LLM cục bộ với độ trễ thấp trên nhiều nền tảng phần cứng khác nhau. GLM-5.3-Flash (GLM5-Next) là dòng mô hình trọng số mở sở hữu kiến trúc chú ý lai giữa thưa và tuyến tính, được xây dựng để giảm chi phí vận hành mà vẫn duy trì khả năng xử lý ngữ cảnh dài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#GLM-5#LocalLLaMA#Open-Source AI#LLM Inference

$ subscribe --daily

llama.cpp Bổ Sung Hỗ Trợ Cho Kiến Trúc Mô Hình GLM-5.3-Flash (GLM5-Next) | Daily News