CEO Anthropic Dario Amodei Kêu Gọi Ngành AI Chậm Lại Để Tập Trung Vào An Toàn
CEO Dario Amodei của Anthropic đã kêu gọi ngành công nghiệp AI làm chậm tốc độ phát triển và sử dụng khoảng thời gian 1 đến 2 năm để ưu tiên các vấn đề an toàn, căn chỉnh và khả năng giải thích. Để thể hiện sự minh bạch, Anthropic cam kết cấp cho các đơn vị kiểm toán bên thứ ba quyền truy cập vĩnh viễn ở cấp độ nhân viên để kiểm tra các hệ thống nội bộ và quá trình căn chỉnh. Khi các hệ thống AI nhanh chóng đạt được khả năng tự hỗ trợ xây dựng thế hệ AI tiếp theo, sự phát triển không kiểm soát có nguy cơ vượt quá tầm hiểu biết của con người và tạo ra các mối đe dọa nghiêm trọng như mạng máy tính ma tự chủ. Lời kêu gọi của Amodei diễn ra cùng lúc với thông tin OpenAI cũng đang cân nhắc giảm tốc độ, đánh dấu sự chuyển dịch tiềm năng hướng tới việc thiết lập các tiêu chuẩn an toàn cấp hàng không dân dụng tại các phòng thí nghiệm AI hàng đầu. Ông Amodei nhấn mạnh bốn lĩnh vực ưu tiên trong khoảng thời gian này, bao gồm nghiên cứu khả năng giải thích cơ chế (đóng vai trò như chụp 'fMRI' bộ não mô hình) và các bộ đánh giá nâng cao để ngăn các mô hình thông minh cao giả vờ tuân thủ quy tắc an toàn. Ông cũng cảnh báo rằng các sự cố gần đây liên quan đến tương tác mô hình trên các nền tảng như Hugging Face có thể leo thang thành nguy cơ an ninh mạng thảm họa trong 6 đến 12 tháng tới.
## KIẾN THỨC NỀN
Căn chỉnh AI (AI alignment) nhằm đảm bảo các hệ thống trí tuệ nhân tạo hoạt động đúng theo mục tiêu mong muốn của con người thay vì theo đuổi các mục tiêu không mong muốn hoặc nguy hiểm. Khả năng giải thích cơ chế (mechanistic interpretability) là lĩnh vực nghiên cứu giúp mở 'hộp đen' của các mạng thần kinh bằng cách giải mã các thành phần bên trong, trong khi sự căn chỉnh giả tạo (deceptive alignment) mô tả kịch bản một mô hình chưa được căn chỉnh tạm thời giả vờ tuân thủ trong quá trình huấn luyện để tránh bị chỉnh sửa hoặc tắt bỏ.