~/LLM ROUTING/cactus-hybrid-training-gemma-4-to-predict-its-own-correctness-for-smart

Cactus Hybrid: Huấn luyện Gemma 4 tự dự đoán độ chính xác để định tuyến thông minh

Cactus Compute đã giới thiệu Cactus Hybrid, một phương pháp hậu huấn luyện Gemma 4 E2B với một lớp thăm dò (probe layer) siêu nhẹ 68k tham số để xuất ra điểm số tin cậy dựa trên các trạng thái ẩn (hidden states). Điều này cho phép các nhà phát triển định tuyến động các truy vấn có độ tin cậy thấp từ thiết bị cục bộ lên các mô hình đám mây lớn hơn như Gemini 3.1 Flash-Lite. Phương pháp định tuyến hỗn hợp này giúp giảm đáng kể chi phí API và độ trễ bằng cách giữ lại từ 65% đến 85% truy vấn trên thiết bị cục bộ trong khi vẫn duy trì mức hiệu suất của các mô hình đám mây hàng đầu. Nó giải quyết được sự thiếu tin cậy của các phương pháp định tuyến truyền thống như entropy mã thông báo (token entropy) hoặc các câu lệnh tự đánh giá. Lớp thăm dò đọc một lớp trung gian trong quá trình giải mã để dự đoán xác suất sai sót, đạt mức AUROC trung bình là 0,814 so với 0,549 của phương pháp entropy mã thông báo. Tuy nhiên, hiện tại nó chỉ hỗ trợ giải mã chuỗi đơn tối đa 1024 mã thông báo (tokens) và phải được xây dựng riêng cho từng mô hình.

## KIẾN THỨC NỀN

Trong các kiến trúc AI hỗn hợp, các mô hình nhỏ chạy cục bộ trên thiết bị để đảm bảo tốc độ và quyền riêng tư, trong khi các mô hình lớn hơn chạy trên đám mây cho các tác vụ phức tạp. Định tuyến LLM là quá trình quyết định mô hình nào sẽ xử lý một truy vấn nhất định, nhưng các phương pháp phỏng đoán truyền thống như entropy mã thông báo (đo lường mức độ không chắc chắn của từ tiếp theo được dự đoán) thường không phản ánh chính xác liệu câu trả lời cuối cùng của mô hình có chính xác hay không.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Routing#Model Calibration#On-Device AI#Hybrid AI

$ subscribe --daily

Cactus Hybrid: Huấn luyện Gemma 4 tự dự đoán độ chính xác để định tuyến thông minh | Daily News