~/LLAMA CPP/llama-cpp-release-b10224-adds-webgpu-f16-repeat-support

llama.cpp Phát Hành Bản b10224 Bổ Sung Hỗ Trợ f16 Repeat Cho WebGPU

Dự án llama.cpp đã phát hành phiên bản b10224, giới thiệu hỗ trợ cho các thao tác f16 repeat trong backend WebGPU. Bản cập nhật này được triển khai thông qua pull request #26307 thuộc thành phần ggml-webgpu. Bản cập nhật này nâng cao khả năng của backend WebGPU, cho phép thực thi hiệu quả hơn các mô hình dựa trên các phép toán dấu phẩy động nửa chính xác (f16) trực tiếp trong trình duyệt web. Điều này đánh dấu một bước tiến khác hướng tới việc hỗ trợ suy luận AI cục bộ hiệu năng cao, đa nền tảng mà không cần cài đặt ứng dụng native trên máy tính. Bản phát hành bao gồm các bản build sẵn cho nhiều nền tảng khác nhau bao gồm macOS, Linux, Windows, Android và iOS, hỗ trợ các backend như CUDA, Vulkan, OpenVINO và SYCL. Tuy nhiên, bản build dành cho macOS Apple Silicon kích hoạt KleidiAI vẫn bị vô hiệu hóa trong bản phát hành này.

## KIẾN THỨC NỀN

llama.cpp là một thư viện mã nguồn mở viết bằng C/C++ rất phổ biến được thiết kế để suy luận hiệu quả các mô hình ngôn ngữ lớn cục bộ, đóng vai trò là công cụ cốt lõi cho các công cụ như Ollama. WebGPU là một tiêu chuẩn web và API hiện đại cung cấp cho các ứng dụng web quyền truy cập cấp thấp, hiệu năng cao vào bộ xử lý đồ họa (GPU) để tăng tốc phần cứng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#WebGPU#AI Infrastructure#Open Source

$ subscribe --daily

llama.cpp Phát Hành Bản b10224 Bổ Sung Hỗ Trợ f16 Repeat Cho WebGPU | Daily News