Geoffrey Hinton cùng ký thư ngỏ yêu cầu đánh giá an toàn AI độc lập từ bên thứ ba
Một liên minh các tổ chức giám sát, với sự tham gia ký tên của các nhà tiên phong AI như Geoffrey Hinton và Stuart Russell, đã công bố thư ngỏ đưa ra các yêu cầu tối thiểu cho các đơn vị đánh giá an toàn AI bên thứ ba. Động thái này nhằm phản hồi cam kết gần đây của Anthropic và OpenAI trong việc cho phép chuyên gia bên thứ ba tiếp cận hệ thống, đồng thời nhấn mạnh các chuyên gia này phải được làm việc hoàn toàn độc lập với sự can thiệp của doanh nghiệp. Khi các mô hình AI tiên phong phát triển nhanh chóng, thư ngỏ này nhấn mạnh mối lo ngại rằng sự tự điều chỉnh và các cam kết an toàn tự nguyện của doanh nghiệp có thể biến thành công cụ truyền thông. Việc thiết lập cơ chế bảo vệ bắt buộc, quyền báo cáo trực tiếp tới hội đồng quản trị và quyền truy cập không bị giám sát cho các kiểm toán viên độc lập là yếu tố then chốt để đảm bảo quản trị AI hiệu quả và minh bạch. Thư ngỏ quy định các chuyên gia đánh giá cắm chốt phải có quyền truy cập hệ thống và dữ liệu tương đương với nhân sự nội bộ, có toàn quyền công bố kết quả đánh giá và có kênh trao đổi trực tiếp với hội đồng quản trị mà không bị công ty lọc thông tin. Ngoài ra, văn bản yêu cầu có cơ chế bảo vệ các chuyên gia khỏi sự trả đũa từ các phòng thí nghiệm AI, đồng thời kêu gọi thành lập các đội ngũ đánh giá đa dạng bao quát nhiều lĩnh vực rủi ro như an toàn sinh học và nguy cơ AI mất kiểm soát.
## KIẾN THỨC NỀN
Các đơn vị phát triển AI tiên phong như OpenAI và Anthropic đang tạo ra các mô hình ngày càng mạnh mẽ nhưng cũng tiềm ẩn nhiều rủi ro phức tạp, bao gồm nguy cơ bị lạm dụng để tấn công mạng hoặc đe dọa an ninh sinh học. Các tổ chức đánh giá độc lập thường thực hiện kiểm thử tấn công (red-teaming) và kiểm toán an toàn trên các mô hình này, nhưng khả năng phát hiện lỗ hổng của họ phụ thuộc lớn vào việc được truy cập dữ liệu không qua kiểm duyệt và giữ vững tính độc lập khỏi các lợi ích thương mại.