OpenAI Được Cho Là Đã Cải Thiện Hiệu Suất Của Mô Hình Giả Lập GPT-5.6 Sol Trên Benchmark ARC-AGI-3
Một báo cáo tin tức công nghệ Trung Quốc cho biết OpenAI đã cải thiện 188,42% hiệu suất của mô hình giả định "GPT-5.6 Sol" trên bài kiểm tra benchmark tương tác ARC-AGI-3, nâng điểm số lên 38,3%. Cải tiến này được cho là đạt được nhờ áp dụng hai giải pháp: bảo toàn suy luận (inference preservation) và nén ngữ cảnh (context compression) trong khung vận hành (harness) của mô hình. Mặc dù báo cáo này đề cập đến các mô hình chưa tồn tại và các mốc thời gian trong tương lai (gợi ý đây là một kịch bản giả lập hoặc suy đoán), các kỹ thuật cốt lõi như duy trì lịch sử suy luận và quản lý việc cắt giảm ngữ cảnh vẫn đóng vai trò rất quan trọng để cải thiện hiệu suất của LLM trong các quy trình tự động (agentic workflows). Quá trình tối ưu hóa đã giải quyết hai lỗi lớn: việc loại bỏ lịch sử suy luận riêng tư sau mỗi hành động và việc mất lịch sử hành động ban đầu do cơ chế cắt giảm ngữ cảnh cuộn. Bằng cách truyền ID phản hồi trước đó qua Responses API và nén ngữ cảnh, mô hình đã giữ lại được chiến lược của mình đồng thời giảm lượng token đầu ra xuống còn một phần sáu.
## KIẾN THỨC NỀN
Abstraction and Reasoning Corpus cho AGI (ARC-AGI) là một bộ công cụ đánh giá (benchmark) được thiết kế để đo lường khả năng học các kỹ năng mới và thích ứng với môi trường mới của AI, thay vì chỉ ghi nhớ kiến thức. "Harness" (khung vận hành) đề cập đến kiến trúc hệ thống bên ngoài bao bọc mô hình ngôn ngữ để cung cấp môi trường chạy, tích hợp công cụ và các vòng lặp phản hồi.