llama.cpp Phát Hành Bản b11382 Bổ Sung Hỗ Trợ Float16 Cho WebGPU
Bản phát hành b11382 của llama.cpp bổ sung hỗ trợ số thực dấu phẩy động 16-bit (f16) cho các thao tác tensor `fill` và `set_rows` trong backend WebGPU. Cập nhật này giúp cải thiện khả năng xử lý độ chính xác dữ liệu và hiệu suất bộ nhớ khi suy luận LLM trên trình duyệt. Mở rộng hỗ trợ float16 trong backend WebGPU giúp các mô hình ngôn ngữ nguồn mở chạy hiệu quả hơn trực tiếp bên trong trình duyệt web. Điều này làm giảm mức tiêu thụ bộ nhớ khi chạy và tăng tốc các thao tác tensor phức tạp mà không cần cài đặt CUDA bản địa rắc rối. Bản sửa lỗi (PR #29897) kích hoạt tính toán số thực độ chính xác bán phần cho các thao tác lấp đầy ma trận và thiết lập hàng trên bộ đệm GPU. Các bản dựng sẵn cho build b11382 đã được phát hành trên nhiều nền tảng bao gồm Linux, macOS, Windows, Android và Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là thư viện C/C++ nguồn mở phổ biến được thiết kế để suy luận nhanh các Mô hình Ngôn ngữ Lớn (LLM) trên thiết bị cá nhân. WebGPU là chuẩn Web hiện đại cung cấp khả năng truy cập hiệu năng cao, cấp thấp đến bộ xử lý đồ họa (GPU) ngay trong môi trường trình duyệt. Sử dụng độ chính xác số thực 16-bit (f16) thay cho float 32-bit (fp32) giúp giảm một nửa băng thông bộ nhớ và tăng tốc đáng kể các tác vụ AI trên GPU hiện đại.