~/LLM/llama-cpp-v0-6-0-released-with-extended-batch-api-and-apple

llama.cpp v0.6.0 Phát Hành Cùng Extended Batch API Và Tối Ưu Hóa Apple GPU

Phiên bản llama.cpp 0.6.0 giới thiệu API batch mở rộng llama_batch_ext hỗ trợ đầu vào kết hợp token/embedding và state embedding, đồng thời bổ sung hỗ trợ cho các kiến trúc mô hình mới như mô hình lai 320B GLM-5.3-Flash. Bản cập nhật cũng mang lại hiệu năng vượt trội, bao gồm khả năng nhân ma trận nhanh hơn tới ~3 lần trên GPU Apple và suy luận đầu cơ MTP cho Qwen4Exp. Là một framework nền tảng cho suy luận LLM mã nguồn mở, các bản cập nhật của llama.cpp cho phép các nhà phát triển vận hành hiệu quả các mô hình đa thức và mô hình ra quyết định phức tạp trên phần cứng cục bộ. Các cải tiến hiệu năng trên Metal và Vulkan giúp giảm đáng kể độ trễ và yêu cầu tài nguyên trên các thiết bị người dùng. Bản phát hành bổ sung endpoint server mới /v1/systemone dành cho các mô hình ra quyết định và nâng cấp định dạng lưu trữ phiên lên LLAMA_SESSION_VERSION 11. Các cải tiến phần cứng cấp thấp bao gồm kernel flash attention Metal tensor-API cho F16 KV cache và hỗ trợ sparse flash attention cho KV cache được định lượng trên Vulkan.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để suy luận Mô hình Ngôn ngữ Lớn (LLM) định lượng với độ trễ thấp trên nhiều loại phần cứng khác nhau. Kỹ thuật giải mã đầu cơ như Dự đoán đa token (MTP) giúp tăng tốc độ suy luận bằng cách dự đoán trước nhiều token ứng viên qua các lớp dự thảo chuyên biệt trước khi xác minh song song với mô hình chính.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llm#llama-cpp#machine-learning#ai-infrastructure#hardware-acceleration

$ subscribe --daily

llama.cpp v0.6.0 Phát Hành Cùng Extended Batch API Và Tối Ưu Hóa Apple GPU | Daily News