Các nhà nghiên cứu dùng Machine Unlearning để loại bỏ kiểm duyệt từ mô hình Qwen
Các nhà nghiên cứu tại Hirundo đã phát hành các phiên bản trọng số mở "Westernized" của Qwen3.6-35B-A3B và Qwen3.5-4B, áp dụng kỹ thuật machine unlearning để giảm tỷ lệ kiểm duyệt và tuyên truyền theo định hướng chính trị của Đảng Cộng sản Trung Quốc từ 89.8% xuống 2.8%. Quá trình này vẫn bảo toàn năng lực chung của mô hình, với điểm số benchmark chỉ chênh lệch trung bình 0.72 điểm. Nghiên cứu này chứng minh một phương pháp chính xác để loại bỏ định kiến chính trị và sự kiểm duyệt khỏi các mô hình LLM trọng số mở mà không làm hỏng khả năng suy luận tổng thể hay hàng rào an toàn cơ bản. Điều này cung cấp cho cộng đồng AI nguồn mở một giải pháp thay thế hiệu quả cho các phương pháp loại bỏ tính năng thô sơ như abliteration khi muốn điều chỉnh mô hình nền tảng cho các bối cảnh địa chính trị khác nhau. Khác với abliteration (vốn loại bỏ hoàn toàn khả năng từ chối của mô hình với mọi câu lệnh), phương pháp của Hirundo huấn luyện một LoRA adapter bằng mục tiêu học quên hành vi kết hợp với tập dữ liệu duy trì (retain set) để bảo vệ năng lực chung và tính an toàn. Thay vì thay thế bằng một tư tưởng chính trị đối lập, mô hình sau khi học quên sẽ trình bày góc nhìn trung lập, đa chiều về các chủ đề nhạy cảm như chủ quyền của Đài Loan.
## KIẾN THỨC NỀN
Machine unlearning (học quên) trong các mô hình ngôn ngữ lớn là tập hợp các kỹ thuật được thiết kế để xóa bỏ một cách có chọn lọc tri thức, hành vi hoặc định kiến cụ thể khỏi trọng số mô hình sau khi huấn luyện. Các mô hình LLM Trung Quốc có trọng số mở như dòng Qwen của Alibaba sở hữu kỹ thuật hàng đầu nhưng lại bị gắn các quy định kiểm duyệt nghiêm ngặt về chủ đề chính trị, vốn tồn tại sâu trong trọng số mô hình ngay cả khi thay đổi câu lệnh hệ thống (system prompt).