Cảnh báo rủi ro bảo mật khi sử dụng các mô hình LLM abliterated
Một bài thảo luận trên r/LocalLLaMA cảnh báo về các lỗ hổng bảo mật tiềm ẩn khi triển khai các mô hình ngôn ngữ mã nguồn mở đã qua xử lý abliterated. Cảnh báo lưu ý người dùng rằng việc loại bỏ các hàng rào an toàn có thể khiến hệ thống dễ bị tấn công hoặc bị khai thác để thực thi mã độc. Các mô hình abliterated đang trở nên phổ biến trong cộng đồng LLM cục bộ vì chúng bỏ qua cơ chế từ chối mà không cần tinh chỉnh tốn kém tài nguyên. Tuy nhiên, việc loại bỏ các rào cản an toàn này khiến mô hình dễ bị tấn công prompt injection và thực hiện các hành vi trái phép hơn khi được kết nối với API hệ thống hoặc các công cụ agent. Khác với các bản fine-tune uncensored thông thường, kỹ thuật abliteration hoạt động bằng cách can thiệp vào các vectơ kích hoạt nội tại để xóa bỏ phản ứng từ chối. Khi các mô hình không còn rào cản này được cấp quyền thực thi hoặc tích hợp vào quy trình tự động, kẻ tấn công có thể thao túng chúng để thực hiện các thao tác trái phép trên máy chủ.
## KIẾN THỨC NỀN
Các mô hình AI abliterated là các LLM mã nguồn mở đã được loại bỏ toán học các cơ chế từ chối khỏi các lớp kích hoạt nội tại. Quá trình căn chỉnh AI thông thường sử dụng các kỹ thuật như Học tăng cường từ phản hồi của con người (RLHF) để dạy mô hình từ chối các yêu cầu nguy hiểm, nhưng abliteration sẽ triệt tiêu hành vi từ chối này để mô hình phản hồi mọi câu lệnh.