~/AI SAFETY/openai-proposes-frontier-ai-safety-framework-granting-executive-veto-power

OpenAI Đề Xuất Khung An Toàn AI Tiên Tiến Cấp Quyền Phủ Quyết Cho Lãnh Đạo

OpenAI đã công bố bộ nguyên tắc hướng dẫn an toàn, yêu cầu tài liệu lập luận an toàn có cấu trúc trước khi bắt đầu huấn luyện học tăng cường cho các mô hình AI tiên tiến. Theo đề xuất này, nhiều lãnh đạo cấp cao—bao gồm trưởng bộ phận nghiên cứu, trưởng bộ phận an toàn và nhà khoa học trưởng—phải xem xét kế hoạch huấn luyện và mỗi người đều có quyền phủ quyết cá nhân để dừng việc huấn luyện. Động thái này đánh dấu sự thay đổi trong các quy trình an toàn AI nội bộ khi gắn trực tiếp đánh giá hiệu quả công việc của quản lý cấp cao với trách nhiệm an toàn và xử lý sự cố. Khi các tác tử AI ngày càng được truy cập vào các môi trường nhạy cảm, việc tự động tạm dừng huấn luyện đối với các cảnh báo không được phản hồi sẽ tạo ra rào cản kiểm soát nội bộ nghiêm ngặt hơn trong hệ sinh thái AI tiên tiến. Khung quy định yêu cầu nếu các cảnh báo an toàn ưu tiên cao không được xác nhận trong thời hạn quy định, các nhiệm vụ huấn luyện bị ảnh hưởng sẽ tự động tạm dừng. Quy trình huấn luyện cũng phải dễ dàng theo dõi mọi mục đích sử dụng hạ nguồn của đầu ra từ mô hình chưa căn chỉnh, chẳng hạn như tạo dữ liệu hoặc chấm điểm, để triệt tiêu ảnh hưởng tiêu cực khi cần thiết.

## KIẾN THỨC NỀN

Hồ sơ an toàn (safety case) là một lập luận có cấu trúc đi kèm bằng chứng chứng minh một hệ thống phức tạp vận hành an toàn trong các điều kiện cụ thể, một khái niệm được tiếp thu từ ngành kỹ thuật an toàn cao. AI tiên tiến (frontier AI) chỉ các mô hình học máy cực kỳ năng lực và tiên phong, có thể mang lại những khả năng mới lẫn rủi ro hệ thống. Căn chỉnh AI (AI alignment) tập trung vào việc đảm bảo các mô hình mạnh mẽ này hoạt động nhất quán với ý định và giá trị của con người thay vì xuất hiện các hành vi bất ngờ hoặc không mong muốn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Safety#OpenAI#AI Governance#Frontier Models#Machine Learning

$ subscribe --daily