Chuẩn hóa tính tái lập cho bảng đánh giá tỷ lệ từ chối của LLM trên Model Card
Một cuộc thảo luận trong cộng đồng làm nổi bật sự thiếu tính tái lập trong các bảng đánh giá tỷ lệ từ chối của LLM, dẫn chứng cụ thể từ model card của Qwen3.8-27B FP8 từ OrcaRouter khi tỷ lệ từ chối có sự khác biệt lớn giữa bản gốc và bản abliterated nhưng thiếu các tài liệu tái lập đi kèm. Bài đăng đặt câu hỏi về những tài liệu tối thiểu nào—như dữ liệu tạo thô, cài đặt giải mã, hoặc mã nguồn chấm điểm—là cần thiết để giúp các thử nghiệm này có thể kiểm chứng độc lập. Khi các LLM mã nguồn mở ngày càng được tinh chỉnh nhiều thông qua các kỹ thuật như abliteration để vượt qua rào cản an toàn, các gói tài liệu tái lập chuẩn hóa là cực kỳ quan trọng để xác minh các tuyên bố về an toàn và hiệu năng. Nếu thiếu các thử nghiệm minh bạch, các nhà phát triển không thể so sánh các mô hình một cách đáng tin cậy hoặc tin tưởng vào tỷ lệ từ chối do người tải lên tự công bố. Model card Qwen3.8-27B FP8 của OrcaRouter báo cáo tỷ lệ từ chối từ 0–6% đối với checkpoint đã áp dụng abliteration khi tắt tính năng suy nghĩ (thinking off), so với mức 63.6–99% của mô hình gốc. Tuy nhiên, đánh giá này phụ thuộc vào một bộ phân loại cụm từ mở đầu do người tải lên tự chạy mà không cung cấp dữ liệu tạo thô, cài đặt giải mã hoặc nhãn cho từng prompt.
## KIẾN THỨC NỀN
Abliteration là một kỹ thuật được sử dụng để loại bỏ kiểm duyệt của LLM bằng cách xác định và vô hiệu hóa các hướng kích hoạt cụ thể liên quan đến hành vi từ chối, giúp vượt qua căn chỉnh an toàn mà không cần đào tạo lại hoàn toàn. Model card là một tài liệu ngắn đi kèm với mô hình học máy, mô tả chi tiết về hiệu năng, hạn chế và các chỉ số đánh giá của mô hình đó nhằm thúc đẩy tính minh bạch.