Mistral AI Ra Mắt Shieldstral, Mô Hình Kiểm Duyệt Nội Dung Đa Phương Thức 3B
Mistral AI đã phát hành Shieldstral, một mô hình kiểm duyệt nội dung đa phương thức mã nguồn mở với 3 tỷ tham số theo giấy phép Apache 2.0. Mô hình này hỗ trợ 12 ngôn ngữ, có thể chạy trên một GPU 16GB duy nhất và đạt hiệu suất tối tân (SOTA) trong việc phân loại an toàn. Không giống như các mô hình bảo vệ truyền thống có chính sách an toàn cố định, Shieldstral cho phép các nhà phát triển đưa các quy tắc kiểm duyệt tùy chỉnh trực tiếp vào prompt một cách linh hoạt. Sự linh hoạt này, kết hợp với yêu cầu phần cứng thấp, giúp các rào cản an toàn AI tiên tiến trở nên dễ tiếp cận và dễ thích ứng hơn cho nhiều ứng dụng khác nhau. Mô hình cấu trúc các tác vụ kiểm duyệt thành các câu hỏi nhị phân bằng cách sử dụng ba trường đầu vào: `<Instruct>`, `<Query>`, và `<Document>` (có thể bao gồm văn bản hoặc hình ảnh). Trong quá trình suy luận, mô hình tính toán điểm an toàn bằng cách chuẩn hóa các giá trị logit của hai token "Yes" và "No" thông qua hàm softmax.
## KIẾN THỨC NỀN
Kiểm duyệt nội dung trong AI, thường được triển khai thông qua các "hàng rào bảo vệ" (guardrails), là yếu tố quan trọng để ngăn chặn các mô hình ngôn ngữ lớn tạo ra đầu ra độc hại, gây hại hoặc vi phạm chính sách. Theo truyền thống, các mô hình bảo vệ này có các chính sách an toàn cứng nhắc được tích hợp sẵn vào trọng số của chúng, đòi hỏi phải đào tạo lại hoặc tinh chỉnh tốn kém mỗi khi nguyên tắc kiểm duyệt của doanh nghiệp thay đổi.