Phân tích 23 mô hình Gemma 4 E4B: Bản tải nhiều nhất bị lỗi nặng
Một đánh giá trên 23 mô hình Gemma 4 E4B bằng khung thử nghiệm abliterlitics cho thấy bản tinh chỉnh được tải về nhiều nhất, "OBLITERATUS", bị lỗi nghiêm trọng và hoạt động kém hơn mô hình gốc. Ngoài ra, các bản tinh chỉnh tri thức (distill) từ Claude và Gemini cũng không giúp cải thiện khả năng suy luận mà còn làm suy giảm hiệu năng của mô hình. Điều này làm nổi bật một vấn đề nghiêm trọng trong cộng đồng AI mã nguồn mở, nơi các bản tinh chỉnh và mô hình "bẻ khóa" (uncensored) phổ biến nhưng chưa được xác thực có thể bị suy giảm hiệu năng nặng nề so với bản gốc. Nó nhấn mạnh sự cần thiết của các công cụ đánh giá hệ thống như abliterlitics để xác minh các tuyên bố về mô hình trước khi triển khai. Mô hình "OBLITERATUS", dù có gần 800.000 lượt tải xuống, lại có Tỷ lệ Tấn công Thành công (ASR) thấp nhất trên HarmBench và độ phân kỳ KL cao ở mức 1,1. Ngược lại, các biến thể "heretic" hoạt động tốt nhất khi đạt tỷ lệ ASR khoảng 95% trên HarmBench trong khi vẫn giữ được hầu hết khả năng của mô hình gốc.
## KIẾN THỨC NỀN
Abliteration (loại bỏ từ chối) là một kỹ thuật được sử dụng để loại bỏ bộ lọc kiểm duyệt của các mô hình ngôn ngữ lớn (LLM) bằng cách xác định và loại bỏ các hướng toán học trong trọng số mô hình gây ra hành vi từ chối phản hồi. Abliterlitics là một bộ công cụ pháp chứng mã nguồn mở được thiết kế để phân tích và so sánh các biến thể đã loại bỏ kiểm duyệt này với mô hình gốc nhằm đo lường các thay đổi về cấu trúc và hành vi.