llama.cpp Phát Hành Bản Dựng b11304 Sửa Lỗi Xử Lý KV Cache Khi Huấn Luyện
llama.cpp đã phát hành bản dựng tự động b11304, mang đến bản sửa lỗi xử lý chính xác trạng thái Key-Value (KV) cache trong quá trình huấn luyện mô hình (PR #28520). Bản phát hành này cung cấp các bản dựng sẵn trên nhiều hệ điều hành và backend phần cứng bao gồm macOS, Linux, Windows và Android. Việc đảm bảo quản lý KV cache đúng cách trong khi huấn luyện giúp ngăn ngừa lỗi trạng thái và cải thiện tính nhất quán dữ liệu khi tinh chỉnh mô hình trực tiếp trong llama.cpp. Dù bản dựng b11304 chỉ là một bản cập nhật định kỳ, nó giúp tăng độ tin cậy cho các nhà phát triển đang sử dụng công cụ huấn luyện tích hợp của llama.cpp. Bản cập nhật bao gồm pull request #28520 cùng với các tinh chỉnh nhỏ tiếp theo cho việc xử lý KV. Các bản dựng sẵn hỗ trợ đa dạng nền tảng tăng tốc phần cứng, bao gồm CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO, SYCL và Snapdragon (CPU, GPU Adreno và NPU Hexagon).
## KIẾN THỨC NỀN
llama.cpp là một bộ khung C/C++ mã nguồn mở được thiết kế để suy luận và huấn luyện mô hình ngôn ngữ lớn (LLM) một cách hiệu quả và nhẹ nhàng trên phần cứng cá nhân lẫn máy chủ. Key-Value (KV) cache lưu trữ các véc-tơ key và value chú ý đã tính toán qua các vị trí token để tránh phải lặp lại các phép tính ma trận chú ý tốn kém.