Bản phát hành llama.cpp b10284 sửa lỗi cấp phát bộ nhớ cho các lớp MTP
Dự án llama.cpp đã phát hành phiên bản b10284, mang đến bản sửa lỗi giải quyết các vấn đề cấp phát bộ nhớ trong các lớp Dự đoán đa mã thông báo (MTP). Dự đoán đa mã thông báo (MTP) ngày càng được sử dụng nhiều trong các mô hình ngôn ngữ lớn hiện đại như DeepSeek-V3 để tăng tốc độ suy luận, khiến việc quản lý bộ nhớ ổn định cho các lớp này trở nên quan trọng khi triển khai cục bộ. Bản phát hành này giải quyết cụ thể yêu cầu kéo (pull request) số #26605 để khắc phục các lỗi cấp phát bộ nhớ. Ngoài ra, ghi chú phát hành cho thấy tính năng hỗ trợ KleidiAI cho macOS Apple Silicon (arm64) vẫn đang bị vô hiệu hóa.
## KIẾN THỨC NỀN
llama.cpp là một thư viện phần mềm mã nguồn mở phổ biến cho phép suy luận LLM hiệu quả trên nhiều phần cứng khác nhau, đặc biệt là CPU và GPU cấp người dùng phổ thông. Dự đoán đa mã thông báo (MTP) là một kỹ thuật trong đó mô hình dự đoán đồng thời nhiều mã thông báo thay vì từng mã một, giúp cải thiện hiệu suất huấn luyện và tốc độ tạo văn bản.