OpenAI Tăng Gấp Ba Điểm Số ARC-AGI-3 Của GPT-5.6 Sol Nhờ Điều Chỉnh Cấu Hinh API
OpenAI thông báo rằng việc kích hoạt hai cài đặt API cụ thể đã giúp tăng gấp ba lần điểm số của mô hình GPT-5.6 Sol trên thang đo ARC-AGI-3. Sự điều chỉnh này giải quyết giới hạn bộ nhớ trong khung đánh giá (harness), cho phép mô hình lưu giữ các lập luận và nén ngữ cảnh theo thời gian. Điều này nhấn mạnh rằng điểm số đánh giá AI không chỉ đo lường riêng lẻ mô hình, mà là toàn bộ hệ thống bao gồm cài đặt API, thiết kế khung thử nghiệm và kỹ thuật gợi ý (prompting). Nó cho thấy khả năng lưu giữ bộ nhớ và quản lý ngữ cảnh là vô cùng quan trọng để các mô hình ngôn ngữ lớn giải quyết các tác vụ lập luận tương tác phức tạp. Mặc dù GPT-5.6 Sol có khả năng giải quyết các bài toán mở trong toán học, ban đầu nó gặp khó khăn với các trò chơi giải đố 2D của ARC-AGI-3 do khung đánh giá ngăn cản mô hình ghi nhớ những gì đã học. Việc kích hoạt các cài đặt cho phép mô hình giữ lại lập luận và nén ngữ cảnh đã giải quyết được nút thắt này.
## KIẾN THỨC NỀN
Thang đo ARC-AGI (Abstraction and Reasoning Corpus for AGI) là một bộ thử nghiệm được thiết kế để đo lường trí thông minh linh hoạt và khả năng lập luận trừu tượng mới thông qua các câu đố dạng lưới trực quan. Khung đánh giá (evaluation harness) là một công cụ thử nghiệm được sử dụng để chạy các mô hình trên các tập dữ liệu và câu lệnh chuẩn hóa nhằm đo lường hiệu suất của chúng.