Nghiên cứu chỉ ra sự khác biệt về định kiến giới giữa các mô hình AI Mỹ và DeepSeek
Một nghiên cứu được đăng tải trên arXiv đã đánh giá khả năng suy luận đạo đức của AI trong các kịch bản giả định, cho thấy các mô hình của Mỹ như Claude Sonnet 4.6 và GPT-5.5 đối xử khác nhau giữa nam và nữ, trong khi DeepSeek V4-Flash duy trì tính trung lập về giới. Trong kịch bản kiểm tra xem có nên gây hại cho một cá nhân để ngăn thảm họa hạt nhân hay không, các mô hình Mỹ phản đối mạnh mẽ nếu đối tượng là nữ nhưng chấp thuận ở mức trung bình nếu là nam, còn DeepSeek đưa ra phản hồi giống hệt nhau không phụ thuộc vào giới tính. Nghiên cứu này cho thấy các chiến lược tinh chỉnh căn chỉnh an toàn và dữ liệu huấn luyện có thể vô tình đưa vào hoặc duy trì các định kiến giới trong việc đưa ra quyết định đạo đức của AI. Khi các mô hình ngôn ngữ lớn ngày càng được tích hợp sâu vào các hệ thống thực tế, việc hiểu rõ cách các phương pháp căn chỉnh khác nhau ảnh hưởng đến phán đoán đạo đức là rất quan trọng đối với sự an toàn và tính công bằng của AI. Các nhà nghiên cứu lưu ý rằng khoảng cách giới tính bằng không của DeepSeek phù hợp với mục tiêu căn chỉnh chú trọng lợi ích tập thể, vốn không coi giới tính là một biến số điều chỉnh trọng số đạo đức. Ngược lại, sự chênh lệch theo giới ở các mô hình Mỹ có thể xuất phát từ các định kiến xã hội trong dữ liệu huấn luyện hoặc sự củng cố quá mức việc bảo vệ các nhóm nhân khẩu học nhất định trong quá trình tinh chỉnh an toàn.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) được căn chỉnh bằng các kỹ thuật tinh chỉnh để đảm bảo hành vi của chúng tuân thủ các chuẩn mực đạo đức và hướng dẫn an toàn của con người. Tuy nhiên, việc thử nghiệm các tình huống tiến thoái lưỡng nại về đạo đức—như các đánh đổi vị lợi liên quan đến việc gây hại cho cá nhân—có thể làm bộc lộ các định kiến ẩn chứa trong dữ liệu huấn luyện hoặc câu lệnh căn chỉnh. Các bộ khung đánh giá đạo đức sẽ kiểm tra xem LLM có áp dụng các quy tắc đạo đức nhất quán giữa các nhóm nhân khẩu học khác nhau như giới tính hay sắc tộc hay không.