llama.cpp Phát hành Bản b11371 Bổ sung Hỗ trợ Văn bản cho Mô hình Clef
Bản phát hành b11371 của llama.cpp giới thiệu hỗ trợ xử lý văn bản cho mô hình quyết định Clef của Cloudflare thông qua pull request #29831. Cập nhật này cũng bao gồm các cải tiến hiệu năng đồ thị tĩnh (static graph) và cập nhật cho gói gguf-py. Các nhà phát triển chạy đường ống xử lý AI cục bộ hiện có thể thực thi các mô hình quyết định Clef của Cloudflare trực tiếp thông qua công cụ suy luận C/C++ tăng tốc phần cứng của llama.cpp. Điều này mở rộng các tùy chọn thực thi mã nguồn mở cho các luồng công việc đại lý (agentic workflow) và ra quyết định có cấu trúc mà không cần phụ thuộc vào API đám mây. Bản phát hành này bổ sung hỗ trợ riêng cho khả năng xử lý văn bản của Clef, nghĩa là các đầu vào đa phương tiện như hình ảnh hiện chưa được hỗ trợ. Các bản dựng sẵn được cung cấp trên nhiều nền tảng bao gồm macOS, Linux, Windows, Android và thiết bị Snapdragon sử dụng các backend như CUDA, Vulkan và OpenVINO.
## KIẾN THỨC NỀN
llama.cpp là một công cụ suy luận mã nguồn mở C/C++ được sử dụng rộng rãi, tối ưu hóa để chạy các mô hình ngôn ngữ lớn (LLM) một cách hiệu quả trên phần cứng người dùng. Clef là mô hình quyết định trọng số mở do Cloudflare phát triển dựa trên nền tảng Qwen, được thiết kế để chuyển đổi trạng thái hệ thống và lược đồ định kiểu thành các đầu ra quyết định có cấu trúc.