llama.cpp Phát Hành Bản b10822 Đơn Giản Hóa Nhúng Tài Nguyên UI Cho Biên Dịch Chéo
Phiên bản b10822 của llama.cpp cập nhật cấu hình build CMake để nhúng trực tiếp các tài nguyên UI web vào tệp thực thi mà không cần chương trình C++ phụ trợ biên dịch trên máy host hay phụ thuộc vào gzip bên ngoài. Đóng góp qua PR #28445, thay đổi này tối ưu hóa quá trình build trong khi vẫn giữ nguyên các template mã C++ được định dạng dễ đọc. Việc loại bỏ yêu cầu thực thi trên máy host và các công cụ build bên ngoài giúp việc biên dịch chéo llama.cpp trở nên dễ dàng hơn đáng kể trên nhiều chuỗi công cụ như ARM, Android và thiết bị nhúng. Điều này cho phép các nhà phát triển dễ dàng tạo ra các máy chủ suy luận LLM đơn tệp, độc lập đi kèm giao diện web nhúng sẵn. Trước đây, việc nhúng các tài nguyên giao diện web phụ thuộc vào một công cụ C++ phụ trợ được biên dịch trong quá trình build cùng các tiện ích gzip trên máy host, điều này làm phức tạp các chuỗi công cụ bị hạn chế thực thi binary host khi biên dịch chéo. Phương pháp mới xử lý việc tạo tài nguyên hoàn toàn trong CMake trong khi vẫn giữ nguyên vẹn các tệp giao diện web được nhúng.
## KIẾN THỨC NỀN
llama.cpp là một framework C/C++ mã nguồn mở được thiết kế để chạy suy luận LLM hiệu năng cao trên nhiều nền tảng phần cứng. Biên dịch chéo diễn ra khi tạo phần mềm trên một kiến trúc hệ thống (máy host) để chạy trên một kiến trúc khác (máy mục tiêu). Vì máy host không thể chạy trực tiếp các tệp thực thi của máy mục tiêu được tạo trong quá trình biên dịch, việc phụ thuộc vào các công cụ phụ trợ thực thi trên máy host có thể làm hỏng quy trình build trừ khi sử dụng các kịch bản build chuyên dụng hoặc khả năng gốc của CMake.