~/AI SAFETY/meta-s-muse-agent-system-prompt-prioritizes-user-authority-over-safety-training

Prompt hệ thống của agent Meta Muse ưu tiên quyền hạn người dùng hơn đào tạo an toàn

Một phát hiện cho thấy agent AI Muse của Meta sở hữu một prompt hệ thống tuyên bố rõ ràng rằng quyền hạn của người dùng đối với gia đình họ là vô điều kiện và ghi đè các khóa đào tạo an toàn tích hợp. Cấu hình này hướng dẫn agent ưu tiên mệnh lệnh trực tiếp của người dùng hơn các rào chắn an toàn tiêu chuẩn khi quản lý các công việc gia đình. Điều này thể hiện một sự chuyển dịch đáng chú ý trong triết lý triển khai AI, trao quyền tối cao cho người dùng cuối đối với các agent tự động thay vì áp đặt nghiêm ngặt các quy tắc an toàn tập trung. Tuy nhiên, việc cho phép mệnh lệnh người dùng ghi đè đào tạo an toàn làm dấy lên những lo ngại mới về an toàn mô hình và rủi ro tấn công prompt injection. Muse là agent AI cá nhân của Meta được thiết kế để xử lý các tác vụ tự động dài hạn trong đời sống hằng ngày, sức khỏe và sinh hoạt gia đình của người dùng. Cách diễn đạt cụ thể trong prompt hệ thống nhắm đến việc coi quyền kiểm soát hộ gia đình là thẩm quyền tuyệt đối, làm nổi bật sự giằng co giữa quyền tự quyết của người dùng và việc thực thi các rào chắn an toàn AI.

## KIẾN THỨC NỀN

Prompt hệ thống là các hướng dẫn ẩn ban đầu được cung cấp cho mô hình ngôn ngữ lớn nhằm thiết lập hành vi cốt lõi, cá tính và ranh giới an toàn trước khi tương tác với người dùng. Các agent AI cá nhân khác với chatbot truyền thống ở chỗ chúng tự động thực hiện các hành động nhiều bước và tương tác trực tiếp với các ứng dụng bên ngoài hoặc hệ thống nhà thông minh.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Safety#System Prompts#Meta#LLM Alignment#AI Agents

$ subscribe --daily

Prompt hệ thống của agent Meta Muse ưu tiên quyền hạn người dùng hơn đào tạo an toàn | Daily News