Thử nghiệm mô hình Clef của Cloudflare chạy cục bộ với llama.cpp cho kết quả kém
Một lập trình viên đã chạy thử nghiệm mô hình quyết định mã nguồn mở Clef của Cloudflare trên máy cục bộ bằng llama.cpp và ghi nhận độ chính xác phân loại kém trên các câu lệnh kiểm thử cơ bản. Khi dùng bản lượng hóa Q4_K_M, mô hình trả về độ tin cậy thấp hơn hẳn so với các mô hình thay thế như Jev. Cloudflare gần đây đã ra mắt Clef như một mô hình quyết định đa phương thức tốc độ cao phục vụ phân loại có cấu trúc và các quy trình làm việc dạng agent. Kết quả thử nghiệm cục bộ này cho thấy việc lượng hóa hoặc tự host suy luận qua llama.cpp có thể gặp phải vấn đề suy giảm hiệu năng so với triển khai trên đám mây gốc. Khi đánh giá kịch bản hỗ trợ thanh toán đơn giản, bản GGUF Q4_K_M của Clef chỉ trả về điểm tin cậy 'noul' dạng boolean là 0,57 cho yêu cầu hoàn tiền, trong khi mô hình Jev đạt 0,99. Đợt thử nghiệm chạy qua llama.cpp 0.6.0 với 334 token đầu vào cũng ghi nhận điểm tin cậy tổng thể rất thấp trên các tác vụ phân loại mức độ cấp bách và bộ phận xử lý.
## KIẾN THỨC NỀN
Clef của Cloudflare là mô hình quyết định đa phương thức 27B chuyển đổi các sơ đồ câu hỏi có cấu trúc và dữ liệu đầu vào thành quyết định mang tính xác suất. Các định dạng lượng hóa như Q4_K_M nén trọng số mô hình xuống 4-bit để cho phép chạy mô hình ngôn ngữ lớn trên phần cứng cá nhân, dù điều này đôi khi có thể ảnh hưởng đến độ chính xác đối với các tác vụ chuyên biệt.