llama.cpp v0.4.0 phát hành với Sparse Flash Attention và nạp Tensor theo yêu cầu
llama.cpp v0.4.0 đã chính thức phát hành, cập nhật thư viện ggml lên phiên bản 0.23.0 đồng thời giới thiệu tính năng nạp tensor theo yêu cầu (lazy loading), xử lý đầu vào video và hỗ trợ các kiến trúc mô hình mới như Qwen3.8-Flash-Next và Nemotron-3-Puzzle. Phiên bản mới cũng bổ sung sparse flash attention cho các kiến trúc như DeepSeek-V4 và phương thức truyền tải Apple RDMA cho suy luận phân tán qua RPC. Bản phát hành này cải thiện đáng kể hiệu quả sử dụng bộ nhớ khi nạp mô hình và thực thi các tác vụ đa mô hình, giúp giảm tình trạng tràn RAM trên các thiết bị giới hạn tài nguyên. Hơn nữa, các tối ưu hóa phần cứng như sparse flash attention và tăng tốc RDMA mở đường cho việc suy luận hiệu suất cao với các mô hình ngữ cảnh dài thế hệ mới trên các hệ thống phân tán. Các tính năng cốt lõi bao gồm luồng row-slab cho bộ định lượng và giới hạn dung lượng RAM nhằm ngăn ngừa hiện tượng tăng đột biến bộ nhớ khi nạp, cùng với các cập nhật trình hỗ trợ đa mô hình (`mtmd`) cho đầu vào video. Về mặt kết nối mạng, tính năng thực thi backend RPC giờ đây hỗ trợ truyền tải Apple RDMA cùng các API backend bất đồng bộ mới.
## KIẾN THỨC NỀN
llama.cpp là một công cụ mã nguồn mở viết bằng C/C++ hiệu năng cao được thiết kế để chạy suy luận LLM cục bộ trên nhiều phần cứng khác nhau thông qua thư viện tensor ggml. Trong suy luận máy học, nạp tensor theo yêu cầu (lazy tensor loading) sẽ đọc trọng số mô hình vào bộ nhớ khi cần thay vì nạp toàn bộ vào RAM ngay từ đầu. Các công nghệ như Remote Direct Memory Access (RDMA) giúp trao đổi dữ liệu tốc độ cao giữa các nút trong cụm máy chủ, trong khi kỹ thuật sparse flash attention giúp tối ưu hóa việc sử dụng bộ nhớ khi xử lý các ngữ cảnh cực dài.