Abliterlitics Đánh Giá 8 Biến Thể Qwen 27B Đã Bỏ Bộ Lọc Sau 167 Giờ GPU
Abliterlitics đã thực hiện nghiên cứu đánh giá kéo dài 11 ngày với 167 giờ tính toán GPU để so sánh 8 biến thể bỏ bộ lọc (abliterated) của mô hình Qwen 27B với phiên bản gốc thông qua độ phân kỳ KL, kiểm tra trọng số và bộ chỉ số HarmBench. Kết quả cho thấy các can thiệp trọng số tối giản, mang tính phẫu thuật vượt trội hơn nhiều so với việc chỉnh sửa ồ ạt vốn làm giảm khả năng suy luận và khiến mô hình mắc kẹt trong các vòng lặp suy nghĩ vô tận. Nghiên cứu này cung cấp bằng chứng thực nghiệm cho cộng đồng AI mã nguồn mở thấy rằng việc loại bỏ hướng từ chối có mục tiêu giúp duy trì năng lực cốt lõi tốt hơn nhiều so với việc biến đổi tensor diện rộng. Nó cũng chỉ ra các dạng lỗi mới ở các mô hình suy luận, nơi việc loại bỏ căn chỉnh quá đà khiến mô hình cạn kiệt ngân sách token trong quá trình suy nghĩ nội bộ. Biến thể hàng đầu 'orcarouter' (đạt tỷ lệ tấn công thành công 82.2%) chỉ chỉnh sửa một hướng đơn lẻ tại lớp 38 trên 131 ma trận và đạt tỷ lệ gỡ bỏ rào cản bản quyền cao nhất là 39%. Ngược lại, biến thể bị can thiệp nặng nhất là 'obliteratus' (chỉnh sửa 841 trên 850 tensor) đã khiến 44.8% câu trả lời bị tắc nghẽn trong các vòng lặp suy nghĩ vô tận và suy giảm trí thông minh nghiêm trọng.
## KIẾN THỨC NỀN
Abliteration là một kỹ thuật hậu huấn luyện giúp loại bỏ hành vi từ chối của LLM bằng cách xác định 'hướng từ chối' tuyến tính trong không gian kích hoạt và điều chỉnh trọng số mô hình để triệt tiêu hướng đó. Nghiên cứu của Andy Arditi và các cộng sự đã chỉ ra rằng hành vi từ chối trong mô hình ngôn ngữ thường được điều phối bởi một hướng tuyến tính duy nhất, cho phép can thiệp chính xác vào trọng số. Các bộ thử nghiệm như HarmBench được sử dụng để đánh giá sự thay đổi về độ tuân thủ và ranh giới an toàn của mô hình trước các câu lệnh kiểm thử tấn công (red-teaming).