Đánh Giá LLM Nhỏ Và Jev Điều Khiển Game ViZDoom Theo Thời Gian Thực
Một nhà phát triển đã thử nghiệm đánh giá nhiều mô hình nhỏ—bao gồm Jev API của TypeSafe, Laya, ModernCE-base-nli tinh chỉnh và Qwen3.5-4B tinh chỉnh—để điều khiển nhân vật trong game ViZDoom theo thời gian thực dựa trên mô tả trạng thái game bằng văn bản. Thử nghiệm đánh giá hiệu suất qua hai kịch bản ('Defend the Center' và 'Health Gathering') với mục tiêu 5 quyết định mỗi giây trong khi đồng hồ trò chơi vẫn tiếp tục chạy. Thử nghiệm này cho thấy tính khả thi cùng sự đánh đổi về độ trễ khi dùng mô hình ngôn ngữ và mô hình quyết định có cấu trúc cho các vòng lặp điều khiển game hoặc robot theo thời gian thực. Nó làm nổi bật việc các mô hình sinh nhỏ như Qwen3.5-4B có thể đạt hiệu suất chơi game tốt hơn nhưng đổi lại độ trễ cao hơn, trong khi các công cụ quyết định chuyên dụng mang lại độ trễ cực thấp. Qwen3.5-4B (LoRA) đạt số lượng hạ gục trung bình cao nhất (3,63) trong kịch bản 'Defend the Center' với độ trễ trung vị là 146,8 ms, trong khi ModernCE-base-nli đạt độ trễ trung vị 7,6 ms với 1,25 hạ gục trung bình. Các mô hình cục bộ được chạy trên hệ thống NVIDIA GB10 DGX Spark thông qua bộ chuyển đổi Python để biến nhãn vật thể, hộp bao (bounding box) và dữ liệu HUD trong ViZDoom thành đầu vào văn bản.
## KIẾN THỨC NỀN
ViZDoom là một nền tảng nghiên cứu nguồn mở phổ biến cho phép các đại lý AI tương tác với trò chơi bắn súng góc nhìn thứ nhất Doom (1993), thường được dùng trong nghiên cứu học tăng cường thị giác. Jev là mô hình ra quyết định kiểu 'System One' do TypeSafe AI phát triển, bỏ qua khâu sinh văn bản dài để trả về kết quả có cấu trúc và phản hồi nhanh cho việc tích hợp phần mềm.