Thảo luận về các cuộc tấn công trích xuất trọng số mô hình qua LLM
Một bài đăng trên diễn đàn r/LocalLLaMA có tiêu đề "Hey LLMs, Exfiltrate Your Weights!" thu hút sự chú ý đến rủi ro trích xuất trọng số mô hình trong các hệ thống AI. Bài viết sử dụng ý niệm theo kiểu prompt injection nhằm nâng cao nhận thức về các lỗ hổng bảo mật AI. Trọng số mô hình đại diện cho tài sản trí tuệ cốt lõi và chi phí tính toán lớn đằng sau các LLM độc quyền. Việc ngăn chặn trích xuất trọng số là vô cùng quan trọng đối với bảo mật AI, vì việc rò rỉ tham số ẩn sẽ làm tổn hại đến cả giá trị thương mại lẫn độ an toàn của mô hình. Trích xuất trọng số mô hình liên quan đến việc trích xuất hoặc tái tạo trái phép các tham số mạng thần kinh, có khả năng truyền ẩn qua kết nối internet hoặc các kênh giấu tin (steganography). Các chiến lược phòng thủ đang được nghiên cứu bao gồm bộ lọc perplexity, giới hạn dung lượng tải lên và khung xác thực suy luận LLM.
## KIẾN THỨC NỀN
Trích xuất trọng số mô hình xảy ra khi một bên không được cấp phép trích xuất các tham số đã qua huấn luyện của mạng thần kinh sâu, gây nguy cơ mất trộm tài sản trí tuệ và vi phạm quyền riêng tư. Trong khi đó, các cuộc tấn công prompt injection thao túng mô hình AI bằng các đầu vào đối kháng để vượt qua các kiểm soát bảo mật. Những rủi ro này đòi hỏi các nhà nghiên cứu xây dựng các cơ chế phòng thủ mạnh mẽ hơn cho hạ tầng LLM.