Đánh giá mô hình LLM cục bộ cho gọi công cụ: Qwen3.8-27B dẫn đầu, Bonsai 27B xếp cuối
Một nhà phát triển đã đánh giá 15 mô hình ngôn ngữ lớn (LLM) chạy cục bộ trong tác vụ gọi công cụ tự động bằng bộ kiểm thử Toolery qua 143 kịch bản đa bước. Kết quả cho thấy qwen/qwen3.8-27b đạt vị trí dẫn đầu với 71,8% điểm, trong khi mô hình lượng tử hóa 1-bit prism-ml/bonsai-27b xếp cuối bảng với 50,5%. Khi các LLM trọng số mở ngày càng được triển khai cục bộ cho các quy trình làm việc tự động (agentic), các bài kiểm tra thực nghiệm giúp nhà phát triển hiểu việc nén mô hình ảnh hưởng thế nào đến khả năng thực thi tác vụ thực tế. Kết quả chỉ ra rằng lượng tử hóa cực hạn có thể gây ra lỗi hành vi đặc thù, chẳng hạn như mô hình không nhận biết được thời điểm nên dừng gọi công cụ. Nguyên nhân thất bại chính của Bonsai 27B là vượt quá giới hạn số lần gọi công cụ (103 trên 148 lượt thử thất bại), cho thấy nó chọn đúng công cụ nhưng liên tục gọi thừa một lần. Bên cạnh đó, Bonsai cũng là mô hình chậm nhất trong thử nghiệm với tổng thời gian 6.208 giây, trong khi granite-4.2-8b là mô hình có ít lượt thất bại nhất (69 lượt).
## KIẾN THỨC NỀN
Toolery là một bộ benchmark định tính được thiết kế để đánh giá khả năng gọi công cụ của LLM qua 143 kịch bản chia thành 4 cấp độ khó. Bonsai 27B của PrismML là mô hình đa phương thức 27 tỷ tham số được lượng tử hóa xuống mức 1-bit nhằm thu nhỏ dung lượng xuống khoảng 4 GB RAM để chạy trên thiết bị cá nhân.