Nhà nghiên cứu Anthropic từ chức cùng cảnh báo AI tự cải thiện có thể tiêu diệt loài người
Một nhà nghiên cứu tại Anthropic đã rời khỏi phòng thí nghiệm AI này cùng lời cảnh báo trực tiếp về rủi ro sinh tồn, cho rằng trí tuệ nhân tạo tự cải thiện có thể tiêu diệt toàn bộ loài người. Lời từ chức này làm nổi bật lo ngại ngày càng tăng của nhân viên nội bộ về tốc độ và hướng đi của việc phát triển các năng lực AI nâng cao. Sự ra đi của các nhân sự từ các phòng thí nghiệm AI chú trọng an toàn cho thấy sự căng thẳng dai dẳng giữa áp lực thương mại và việc giảm thiểu rủi ro. Nếu các hệ thống AI đạt được khả năng tự cải thiện đệ quy nhanh hơn tốc độ phát triển của các biện pháp an toàn, con người có nguy cơ mất kiểm soát đối với siêu trí tuệ. Lời từ chức tập trung cụ thể vào mối nguy hiểm của quá trình tự cải thiện đệ quy, nơi các mô hình AI tự sửa đổi mã nguồn để tăng cường trí tuệ một cách nhanh chóng. Mặc dù các lời kêu gọi quản trị an toàn AI đang gia tăng trên toàn cầu, việc các kỹ sư trong cuộc rời đi cho thấy họ vẫn hoài nghi về các khung an toàn hiện tại.
## KIẾN THỨC NỀN
Tự cải thiện đệ quy (Recursive self-improvement) là một kịch bản lý thuyết nơi trí tuệ nhân tạo tổng hợp (AGI) tự viết lại mã nguồn của chính nó, kích hoạt sự "bùng nổ trí tuệ" theo cấp số nhân dẫn đến siêu trí tuệ. Nghiên cứu rủi ro sinh tồn AI xem xét cách một cỗ máy siêu trí tuệ không được căn chỉnh (alignment) chuẩn xác có thể trở nên không thể ngắt kết nối hoặc kiểm soát. Anthropic ban đầu được thành lập bởi các cựu nhà nghiên cứu OpenAI với cam kết ưu tiên an toàn và sự căn chỉnh hơn là mở rộng quy mô một cách thiếu an toàn.