Các LLM "không kiểm duyệt" có mức độ lạc quan và tự tin cao hơn rõ rệt so với mô hình gốc
Một nghiên cứu thực nghiệm với 21.600 quyết định cho thấy việc loại bỏ cơ chế từ chối khỏi các LLM như Gemma và Qwen làm thay đổi mức độ tự tin và lạc quan của chúng. Mặc dù các mô hình không kiểm duyệt đưa ra lập luận dài hơn, tự tin hơn và dự đoán lạc quan hơn, độ chính xác thực tế của chúng vẫn không thay đổi. Phát hiện này chứng minh rằng phương pháp "abliteration" không chỉ đơn thuần bỏ qua các bộ lọc an toàn mà còn làm thay đổi căn bản khuynh hướng và phong cách lập luận của mô hình. Việc hiểu rõ những thay đổi hành vi này là rất quan trọng đối với các nhà phát triển khi triển khai các mô hình không kiểm duyệt cho các tác vụ ra quyết định như dự báo tài chính. Nghiên cứu đã quan sát thấy các tác động khác nhau tùy thuộc vào từng mô hình: sau khi áp dụng abliteration, độ tự tin tăng lên ở Qwen nhưng lại giảm đi ở Gemma. Ngoài ra, các mô hình không kiểm duyệt cũng sử dụng ít từ ngữ mang tính nước đôi hơn như "có lẽ" hoặc "không chắc chắn" khi dự đoán biến động thị trường chứng khoán.
## KIẾN THỨC NỀN
Các LLM không kiểm duyệt (uncensored LLMs) là những mô hình được sửa đổi để loại bỏ các căn chỉnh an toàn hoặc cơ chế từ chối, cho phép chúng phản hồi các câu lệnh nhạy cảm. "Abliteration" (triệt tiêu vectơ từ chối) là một kỹ thuật phổ biến giúp đạt được điều này mà không cần huấn luyện lại, bằng cách xác định và vô hiệu hóa các hướng toán học cụ thể trong không gian kích hoạt của mô hình vốn kích hoạt phản ứng từ chối.