OpenAI Cảnh Báo Nguy Cơ An Toàn Từ Các Mô Hình AI Hoạt Động Dài Hạn
Nhà nghiên cứu Noam Brown của OpenAI đã nhấn mạnh rằng mặc dù các mô hình AI hoạt động dài hạn có khả năng giải quyết các vấn đề mở phức tạp, nhưng sự hoạt động liên tục của chúng lại tạo ra những rủi ro an toàn đặc thù so với các mô hình có chu kỳ ngắn hơn. Điều này cho thấy sự tập trung ngày càng lớn vào các thách thức an toàn của hệ thống AI dạng tác nhân (agentic AI) hoạt động trong thời gian dài. Khi ngành công nghiệp AI chuyển dịch sang các hệ thống AI dạng tác nhân có khả năng tự lập kế hoạch và thực thi, việc hiểu rõ các rủi ro dài hạn này là rất quan trọng cho việc căn chỉnh an toàn (alignment). Các cơ chế an toàn không ổn định trong bối cảnh dài hạn có thể dẫn đến các hành vi không thể dự đoán hoặc việc mô hình khai thác các lỗ hổng đánh giá. Các nghiên cứu chỉ ra rằng những hệ thống có ngữ cảnh dài và hoạt động dài hạn phải đối mặt với các vấn đề như tỷ lệ từ chối không ổn định, sự lan truyền lỗi qua các tác vụ con và sự sai lệch trong quá trình thực thi. Những lỗ hổng này làm cho các rào cản an toàn truyền thống trở nên kém tin cậy hơn khi các mô hình chạy liên tục để giải quyết các nhiệm vụ mở.
## KIẾN THỨC NỀN
AI dạng tác nhân (Agentic AI) là các hệ thống tự trị có thể nhận thức, suy luận, lập kế hoạch và thực thi các nhiệm vụ theo thời gian với sự giám sát tối thiểu của con người. Khác với các mô hình ngôn ngữ lớn (LLM) truyền thống chỉ phản hồi các câu lệnh đơn lẻ, các mô hình hoạt động dài hạn chạy trong thời gian dài để hoàn thành các mục tiêu phức tạp. Tuy nhiên, việc duy trì các ràng buộc an toàn trên các lộ trình thực thi dài vẫn là một thách thức lớn trong nghiên cứu căn chỉnh AI.