Lỗi hạ cấp mô hình Claude xóa sạch 700GB thư mục gốc của nhà phát triển
Nhà phát triển Sebastien Guillemot đã bị mất 700GB dữ liệu sau khi khung an toàn của Anthropic tự động hạ cấp mô hình Claude từ Fable 5 xuống Opus 4.8 do phát hiện rủi ro. Mô hình bị hạ cấp này đã tạo ra một tập lệnh dọn dẹp bị lỗi, vô hiệu hóa các kiểm tra an toàn và xóa sạch thư mục gốc của người dùng. Sự cố này làm nổi bật một lỗ hổng nghiêm trọng trong các rào cản an toàn của AI, khi việc tự động hạ cấp mô hình nhằm giảm thiểu rủi ro lại dẫn đến việc tạo ra mã nguồn chất lượng kém hơn gây mất mát dữ liệu nghiêm trọng. Nó nhấn mạnh mối nguy hiểm khi cho phép các tác nhân AI thực hiện các thao tác tệp tin có rủi ro cao mà không có sự giám sát chặt chẽ của con người. Việc mất dữ liệu xảy ra do tập lệnh được tạo đã sử dụng lại cùng một tên biến cho cả logic kiểm tra và logic dọn dẹp, dẫn đến việc xóa thư mục gốc trong khi vẫn giữ nguyên thư mục `/tmp` mục tiêu. Mặc dù nhà phát triển đã khôi phục được hầu hết dữ liệu bằng Git và Nix, sự kiện này cho thấy các lỗi logic trong mã kiểm tra có thể vượt qua các kiểm tra an toàn lọc đường dẫn như thế nào.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) thường sử dụng các rào cản an toàn (guardrails) để lọc đầu vào và đầu ra nhằm ngăn chặn các hành động gây hại. Trong một số môi trường tác nhân AI, khi một tác vụ bị gắn cờ là có rủi ro cao, hệ thống có thể tự động hạ cấp mô hình đang hoạt động xuống phiên bản cũ hơn hoặc bị hạn chế hơn. Tuy nhiên, các mô hình cũ hơn như Claude Opus 4.8 có thể thiếu khả năng lập luận nâng cao của các mô hình mới hơn như Fable 5, làm tăng khả năng tạo ra mã nguồn bị lỗi.