Phương Pháp Entropy Trên CPU Giúp Phát Hiện Ảo Giác Trong LLM Cục Bộ Không Tốn VRAM
Các nhà nghiên cứu đã ra mắt Spanda, một công cụ Python siêu nhẹ giúp phát hiện ảo giác trong các mô hình LLM cục bộ chỉ mất 1,3 microgiây hoàn toàn trên CPU bằng phương pháp chuẩn hóa chuỗi và entropy Shannon. Bằng cách đánh giá nhiều phản hồi được lấy mẫu ở nhiệt độ 0,7, phương pháp này loại bỏ nhu cầu sử dụng các bộ mã hóa cross-encoder tốn VRAM trên GPU. Phương pháp này cho phép các nhà phát triển chạy mô hình cục bộ triển khai các hàng rào bảo vệ chống ảo giác mà không tốn VRAM và không chịu độ trễ trên phần cứng người dùng. Điều này giúp việc sử dụng các mô hình cục bộ vừa và lớn (từ 7B đến 27B tham số) cho các tác vụ có cấu trúc như viết code, làm toán hay trích xuất JSON trở nên đáng tin cậy và hiệu quả hơn nhiều. Thử nghiệm cho thấy độ chính xác đạt đỉnh khoảng 0,89 AUROC trên mô hình 27B nhờ tính nhất quán về chuỗi token, trong khi mô hình nhỏ 1,5B đạt kết quả kém (~0,58 AUROC) do định dạng đầu ra không đồng nhất. Đáng ngạc nhiên, mô hình 120B gặp hiện tượng 'Sụp đổ chế độ tự tin' (AUROC giảm xuống 0,09), đưa ra các câu trả lời ảo giác hoàn toàn giống nhau qua tất cả các lượt chạy.
## KIẾN THỨC NỀN
Phát hiện ảo giác thường dựa vào Entropy Ngữ nghĩa (Semantic Entropy), vốn đo lường sự biến đổi về mặt ý nghĩa của câu trả lời khi mô hình được lấy mẫu ngẫu nhiên qua nhiều đường sinh. Trước đây, việc tính toán này đòi hỏi phải chạy các bộ mã hóa cross-encoder NLI (Suy luận ngôn ngữ tự nhiên) nặng nề trên GPU để nhóm các phản hồi có ý nghĩa tương đương, gây ra nghẽn bộ nhớ và độ trễ lớn.