llama.cpp Phát Hành Bản b11112 Bổ Sung Hỗ Trợ Đầu Vào Hình Ảnh Trong Kết Quả Gọi Hàm Của Server
Bản dựng b11112 của llama.cpp đã cập nhật thành phần server tích hợp để hỗ trợ nhận dữ liệu đầu vào hình ảnh (`input_image`) trong kết quả đầu ra của các lệnh gọi hàm (function call outputs). Điều này cho phép các mô hình đa thức nhận lại dữ liệu hình ảnh từ các công cụ bên ngoài được thực thi trong quá trình gọi công cụ. Cập nhật này cho phép các nhà phát triển xây dựng các quy trình tác tử AI (agent workflows) đa thức phức tạp, giúp các mô hình LLM chạy cục bộ hoặc trên máy chủ chuyên dụng xử lý các hình ảnh do các công cụ bên ngoài như công cụ thu thập dữ liệu web hoặc kịch bản xử lý ảnh trả về. Điều này giúp API server của llama.cpp đáp ứng tốt hơn các tiêu chuẩn gọi công cụ đa thức hiện đại tương tự như các API thương mại. Bản vá được triển khai thông qua các yêu cầu kéo (pull request) #20663 và #22575, đồng thời bao gồm các dọn dẹp mã nguồn nhỏ như tránh tra cứu kiểu dữ liệu lặp đi lặp lại trong mã C++ của server. Bản phát hành cung cấp các bản dựng sẵn trên nhiều hệ điều hành và phần cứng mục tiêu, bao gồm CUDA 12/13, Vulkan, ROCm, OpenVINO, SYCL và Snapdragon NPU.
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở C/C++ phổ biến được thiết kế để suy luận nhanh và tối ưu bộ nhớ cho các mô hình ngôn ngữ lớn (LLM) cũng như mô hình thị giác-ngôn ngữ trên phần cứng cục bộ. Gọi hàm (function calling hoặc tool calling) là kỹ thuật mà trong đó LLM nhận biết khi nào cần chạy mã bên ngoài, xuất ra các tham số có cấu trúc và nhận lại kết quả thực thi của công cụ vào ngữ cảnh nhắc lệnh để đưa ra câu trả lời cuối cùng.