Bộ lọc an toàn AI phản ứng thái quá kích hoạt cảnh báo nhầm với nấm ăn
Một người dùng phản ánh trợ lý Pi của Inflection AI bị kẹt khi đang xử lý yêu cầu tối ưu hóa chế độ ăn uống do các đề cập đến nấm ăn bị hệ thống lọc an toàn kích hoạt nhầm. Sự cố này làm nổi bật cách các hàng rào an toàn quá nghiêm ngặt trên đám mây có thể gây gián đoạn các tương tác hàng ngày lành tính. Trường hợp này minh họa vấn đề kéo dài về hiện tượng báo động giả trong cơ chế kiểm duyệt LLM, khi các từ ngữ thông dụng lại kích hoạt hàng rào cấm chất độc hại. Các bộ lọc an toàn quá nhạy cảm làm giảm trải nghiệm người dùng và làm suy yếu độ tin cậy của các trợ lý AI khi thực hiện tác vụ tự động hóa hàng ngày. Hệ thống hàng rào an toàn nhiều khả năng đã phân loại nhầm nấm ăn thành nấm gây ảo giác bất hợp pháp, khiến trợ lý Pi dừng hoàn toàn việc tạo phản hồi. Điều này cho thấy hạn chế của các bộ phân loại an toàn thiếu ngữ cảnh khi không đánh giá được bối cảnh tổng thể của yêu cầu từ người dùng như lập kế hoạch bữa ăn.
## KIẾN THỨC NỀN
Các nền tảng mô hình ngôn ngữ lớn (LLM) sử dụng các hàng rào an toàn để giám sát đầu vào và đầu ra nhằm ngăn chặn việc tạo ra nội dung nguy hiểm, bất hợp pháp hoặc không an toàn. Tuy nhiên, việc tinh chỉnh an toàn có thể rất mong manh và thường dựa vào các bộ phân loại cờ báo hiệu các từ nhạy cảm một cách thái quá khi tách khỏi bối cảnh. Inflection AI đã phát triển Pi như một trợ lý AI cá nhân tập trung vào hội thoại đồng cảm và hỗ trợ người dùng.