llama.cpp phát hành phiên bản 0.5.0 với tối ưu hóa backend và hỗ trợ mô hình mới
Công cụ suy luận LLM mã nguồn mở llama.cpp đã phát hành phiên bản 0.5.0, mang đến khả năng tăng tốc conv2d bằng implicit GEMM cho CUDA, các tối ưu hóa hợp nhất Metal MoE và SSM_CONV, cùng tính năng liên kết máy chủ nhiều địa chỉ qua TCP và UNIX socket. Phiên bản này cũng bổ sung hỗ trợ cho các kiến trúc mô hình mới như HRM-Text (DFM Mimir 1B), MiMo-V2.6 và HunyuanOCR, đi kèm các cải tiến cho backend ggml 0.25.0. Bản cập nhật cột mốc quan trọng này giúp nâng cao tốc độ suy luận và hiệu suất trên cả GPU NVIDIA CUDA lẫn phần cứng Apple Silicon, đồng thời mở rộng khả năng hỗ trợ cục bộ cho các LLM đa phương thức và chuyên biệt mới nổi. Ngoài ra, các tính năng máy chủ được cải tiến như liên kết đa địa chỉ giúp việc tích hợp vào hạ tầng AI cục bộ trở nên linh hoạt hơn. Các cập nhật kỹ thuật backend đáng chú ý bao gồm đồ thị CUDA cho việc dự phỏng Multi-Token Prediction (MTP), khởi tạo LoRA từ con trỏ tệp, và hỗ trợ đầu vào hình ảnh cho các lời gọi hàm trên máy chủ. Các cải tiến kiến trúc lõi cũng bao gồm các toán tử siêu kết nối (hyper-connection ops) và sparse flash attention cho Qwen4Exp, hỗ trợ hợp nhất QKV cho Muse Glimmer, cùng các sửa lỗi bộ phân tích cú pháp trò chuyện cho các mô hình như DeepSeek V3.2/V4.
## KIẾN THỨC NỀN
llama.cpp là thư viện suy luận mã nguồn mở C/C++ phổ biến được thiết kế để chạy các mô hình ngôn ngữ lớn một cách hiệu quả trên phần cứng người dùng cá nhân, dựa trên thư viện đại số tensor ggml. Các phép toán như nhân bản chập (conv2d) và định tuyến Mixture-of-Experts (MoE) thường gây ra nghẽn băng thông bộ nhớ hoặc tính toán, khiến các kỹ thuật tăng tốc GPU cấp thấp như implicit GEMM (Phép nhân ma trận tổng quát ẩn) và hợp nhất kernel trở nên thiết yếu đối với suy luận hiệu năng cao.