CivBench đánh giá khả năng lập kế hoạch chiến lược dài hạn của LLM trong Civilization V
Các nhà nghiên cứu đã giới thiệu bộ khung đánh giá CivBench nhằm kiểm thử các đại lý LLM về khả năng suy luận chiến lược dài hạn theo lượt trong trò chơi Civilization V qua hàng trăm lượt chơi. Kết quả thử nghiệm ban đầu cho thấy GLM-5.3 vượt qua Opus-5.5, trong khi mô hình trọng số mở Qwen-3.8-27B thể hiện kết quả ấn tượng. Các bộ kiểm thử mô hình ngôn ngữ tiêu chuẩn thường khó đo lường việc ra quyết định tầm xa, nơi các lựa chọn ban đầu ảnh hưởng đến kết quả sau 50 đến hơn 100 lượt chơi. Việc thử nghiệm LLM trong môi trường chiến thuật đa đại lý cung cấp thước đo nghiêm ngặt về khả năng lập kế hoạch dài hạn, theo dõi trạng thái và quản lý tài nguyên. Trong thiết lập kiểm soát của CivBench, các mô hình được xoay vòng qua các bản đồ xuất phát cố định, trong đó LLM chỉ đạo chiến lược cấp cao còn AI tiêu chuẩn của trò chơi xử lý việc điều khiển vi mô. Dự án mã nguồn mở này hỗ trợ cả các máy chủ cục bộ tương thích OpenAI như Qwen-3.8-27B lẫn các nhà cung cấp API thương mại.
## KIẾN THỨC NỀN
Civilization V là trò chơi chiến thuật theo lượt, nơi người chơi xây dựng đế chế qua nhiều thế kỷ thông qua khoa học, ngoại giao, mở rộng lãnh thổ và chiến tranh. Việc đánh giá mô hình ngôn ngữ trong môi trường trò chơi dựa trên các thiết lập đại lý (agentic setup) sử dụng lệnh gọi hàm hoặc giao thức công cụ để tương tác với trạng thái trò chơi trong khoảng thời gian dài.