Lập trình viên thử nghiệm mô hình thế giới AI 1B chạy real-time trên phần cứng cá nhân
Một lập trình viên độc lập đã huấn luyện mô hình thế giới Transformer thuần khoảng 960 triệu tham số, có khả năng biến ảnh tĩnh thành dòng video tương tác trên GPU cá nhân. Mô hình nâng cấp này hỗ trợ điều khiển hành động bằng bàn phím (WASD) và thay đổi prompt văn bản trực tiếp trong khi sinh video, cho phép người dùng chỉnh sửa cảnh vật hoặc nhân vật ngay lập tức. Hầu hết các mô hình sinh video và mô hình thế giới hiện nay đòi hỏi GPU cấp trung tâm dữ liệu và bị độ trễ lớn, khiến việc khởi tạo tương tác tại chỗ không khả thi. Việc chứng minh mô hình thế giới điều khiển bằng văn bản thời gian thực chạy được trên phần cứng tiêu dùng như GPU RTX và MacBook mở ra triển vọng mới cho ứng dụng tạo game cục bộ và môi trường AI tương tác. Mô hình gồm 28 block, 20 head, dùng mặt nạ nhân quả theo khối (block causal mask) và cross-attention cho văn bản, kết hợp điều kiện AdaLN cho đầu vào hành động. Được huấn luyện bằng kỹ thuật diffusion forcing với việc thêm nhiễu độc lập từng khung hình, mô hình đạt 50–60 FPS trên RTX 5090 (bị giới hạn xuống 12 FPS) nhờ bộ nhớ đệm KV cache cửa sổ trượt 80 khung hình và 2–5 bước khuếch tán mỗi khung hình.
## KIẾN THỨC NỀN
Mô hình thế giới AI (world model) là một kiến trúc học máy dự đoán được thiết kế để tự xây dựng mô hình biểu diễn nội bộ về môi trường và dự đoán sự thay đổi theo thời gian dựa trên các hành động. Các mô hình sinh video truyền thống thường tạo ra toàn bộ đoạn video một cách thụ động, thiếu tính tương tác thời gian thực hoặc khả năng điều khiển chính xác từ người dùng.