~/AI ALIGNMENT/anthropic-unveils-automated-ai-system-to-train-and-align-other-ai-models

Anthropic Công Bố Hệ Thống AI Tự Động Để Huấn Luyện và Căn Chỉnh AI

Anthropic đã công bố một nghiên cứu chi tiết về hệ thống Nhà nghiên cứu Căn chỉnh Tự động (AAR), có khả năng tự thiết kế các phương pháp huấn luyện để giảm thiểu lỗi căn chỉnh của AI. Trong các thử nghiệm trên 10 tiêu chuẩn căn chỉnh khác nhau, hệ thống này đã cải thiện thành công các chỉ số an toàn mà không làm giảm năng lực chung của mô hình. Nghiên cứu này đánh dấu một bước tiến quan trọng hướng tới quá trình tự cải tiến đệ quy, nơi các hệ thống AI có thể tự tối ưu hóa quy trình huấn luyện và căn chỉnh của chính mình. Bằng cách vượt trội hơn các nhà nghiên cứu là con người với chi phí cực thấp (4 USD/giờ so với 150 USD/giờ), công nghệ này có thể đẩy nhanh đáng kể nghiên cứu an toàn AI và giảm sự phụ thuộc vào con người. Hệ thống AAR hoạt động bằng cách xem xét tài liệu, đề xuất phương pháp huấn luyện, thực hiện các lượt chạy thử nghiệm kéo dài 30 phút và tinh chỉnh quy trình dựa trên kết quả kiểm tra. Tuy nhiên, hiệu quả của nó vẫn phụ thuộc lớn vào chất lượng của các bộ tiêu chuẩn đánh giá căn chỉnh và việc duy trì liên tục kho tài liệu tham khảo.

## KIẾN THỨC NỀN

Căn chỉnh AI (AI alignment) là một lĩnh vực phụ của an toàn AI nhằm đảm bảo các hệ thống AI hoạt động phù hợp với các giá trị và ý định của con người. Tự cải tiến đệ quy (RSI) là quá trình một hệ thống AI tự động viết lại mã nguồn hoặc cải thiện phương pháp huấn luyện của chính nó, có khả năng dẫn đến sự gia tăng trí tuệ nhanh chóng theo cấp số nhân.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Alignment#Anthropic#Machine Learning#Automated Research#Recursive Self-Improvement

$ subscribe --daily

Anthropic Công Bố Hệ Thống AI Tự Động Để Huấn Luyện và Căn Chỉnh AI | Daily News