~/LLAMA CPP/llama-cpp-release-b11279-adds-support-for-glm-5-3-flash-architecture

llama.cpp Bản phát hành b11279 Bổ sung Hỗ trợ cho Kiến trúc GLM-5.3-Flash

Công cụ suy luận LLM mã nguồn mở llama.cpp đã phát hành bản dựng b11279, bổ sung hỗ trợ kiến trúc gốc cho mô hình GLM-5.3-Flash (GLM5-Next) của Z.ai. Bản cập nhật mang đến việc tích hợp chỉ số bộ nhớ hỗn hợp, xử lý đa luồng, bố cục k-pool duy trì liên tục qua các micro-batch và các tối ưu hóa cho việc giải mã ngữ cảnh dài. Việc bổ sung hỗ trợ cho GLM-5.3-Flash cho phép các nhà phát triển và nghiên cứu chạy mô hình hỗn hợp hiệu năng cao mới nhất của Z.ai ngay trên thiết bị cá nhân. Điều này mở rộng phạm vi các kiến trúc mở tiên tiến có thể truy cập được thông qua các khung tối ưu hóa CPU và GPU nhẹ. Yêu cầu kéo (#27773) tích hợp các điểm kiểm tra hoàn tác trạng thái tuần hoàn, tái cấu trúc việc xử lý đồ thị bộ nhớ cơ sở và cải thiện phân bổ bộ đệm tính toán để tăng tốc các thao tác nạp trước (prefill). Ngoài ra, bản cập nhật cũng khắc phục các sự cố phân bổ đồ thị trên các nền tảng CUDA, ROCm, Vulkan, Metal và WebGPU.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở được thiết kế để chạy các mô hình ngôn ngữ lớn cục bộ với hiệu suất cao trên nhiều nền tảng phần cứng khác nhau. GLM-5.3-Flash là một LLM đa thức nguyên bản do Z.ai phát triển, sở hữu kiến trúc được thiết kế lại nhằm đạt hiệu năng cao với chi phí suy luận thấp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#llm-inference#open-source-ai#glm

$ subscribe --daily

llama.cpp Bản phát hành b11279 Bổ sung Hỗ trợ cho Kiến trúc GLM-5.3-Flash | Daily News