Tinh chỉnh Gemma 12B cải thiện 2,7 lần gọi công cụ trên VRAM 16GB
Một nhà phát triển đã tinh chỉnh mô hình Gemma 12B để đạt được mức cải thiện gấp 2,7 lần trong việc gọi công cụ (tool calling) và sử dụng giao diện dòng lệnh (CLI). Mô hình tinh chỉnh này cũng giúp tăng 15,7% tần suất gọi công cụ, đồng thời tác giả đã phát hành các trọng số lượng tử hóa Q4_K_M được tối ưu hóa cho việc triển khai cục bộ. Dự án này chứng minh cách tinh chỉnh có mục tiêu có thể vượt qua các giới hạn của các LLM mã nguồn mở nhỏ hơn trong các quy trình làm việc dạng tác nhân (agentic) dưới các ràng buộc phần cứng tiêu dùng. Bằng cách tối ưu hóa mô hình 12B để chạy trên VRAM 16GB, các nhà phát triển có thể tiếp cận khả năng gọi công cụ đáng tin cậy tại địa phương mà không cần GPU cấp doanh nghiệp đắt tiền. Các trọng số của mô hình đã được chuyển đổi từ FP16 sang định dạng lượng tử hóa Q4_K_M, giúp chúng tương thích với các công cụ suy luận cục bộ như llama.cpp và Ollama. Mặc dù Q4_K_M giảm đáng kể mức sử dụng bộ nhớ, người dùng cần lưu ý rằng lỗi lượng tử hóa có thể tích tụ trên các cửa sổ ngữ cảnh dài từ 8K token trở lên.
## KIẾN THỨC NỀN
Gọi công cụ (tool calling) là một cơ chế cho phép các mô hình ngôn ngữ lớn gọi các API bên ngoài, cơ sở dữ liệu hoặc công cụ dòng lệnh để thực hiện các hành động ngoài việc tạo văn bản. Để chạy các mô hình này trên phần cứng tiêu dùng, các nhà phát triển thường sử dụng các kỹ thuật lượng tử hóa như Q4_K_M để nén trọng số mô hình nhằm vừa vặn với bộ nhớ GPU (VRAM) hạn chế, đồng thời sử dụng các công cụ như llama.cpp để thực thi cục bộ.