Jevman: Bộ kiểm thử mở đánh giá các mô hình ra quyết định AI qua trò chơi Pac-Man
Một bộ khung kiểm thử mã nguồn mở có tên "jevman" đã được phát hành để đánh giá các mô hình ra quyết định AI độ trễ thấp bằng cách cho chúng chơi Pac-Man theo thời gian thực. Bộ kiểm thử đã so sánh sáu mô hình ra quyết định, bao gồm jev 1.13, GPT-6 Luna và Clef của Cloudflare, đồng thời công bố bảng xếp hạng dựa trên 100 lượt chạy cho mỗi mô hình. Khi sự phát triển AI chuyển dịch từ giao diện trò chuyện sang các API ra quyết định chuyên biệt, jevman cung cấp một môi trường tương tác để kiểm thử hiệu năng mô hình trong điều kiện thời gian thực. Công cụ này cho phép các nhà phát triển dễ dàng đánh giá mô hình tinh chỉnh riêng so với các giải pháp thương mại và mã nguồn mở lớn. Qua 100 lượt chạy đánh giá, jev 1.13 đạt điểm trung bình cao nhất là 2.750 điểm (độ trễ trung bình 290 ms), theo sát là GPT-6 Luna với 2.568 điểm (độ trễ 179 ms) và Clef Flash với 2.538 điểm (độ trễ 256 ms). Người chơi cũng có thể đóng vai Pac-Man để đấu với các con ma do các mô hình ra quyết định điều khiển.
## KIẾN THỨC NỀN
Các mô hình ra quyết định AI đại diện cho một nhóm mô hình mới không dùng cho trò chuyện, được thiết kế để nhận trạng thái ứng dụng (như JSON hoặc khung hình video) và trả về các lựa chọn có cấu trúc hoặc xác suất. Khác với các mô hình ngôn ngữ lớn tổng quát tối ưu cho trò chuyện bằng văn bản, các mô hình ra quyết định ưu tiên tốc độ phản hồi tính bằng miligiây để thực hiện hành động tự động trong môi trường động.