H3-World: Điều khiển mô hình thế giới video bằng ngôn ngữ hiệu quả tham số
Các nhà nghiên cứu đã giới thiệu H3-World, một bộ khung nguồn mở tiết kiệm tham số tận dụng mô hình video MiniMax-H3 để điều khiển chính xác chuyển động của nhân vật và camera theo thời gian thông qua câu lệnh văn bản. Bằng cách chỉ huấn luyện 0,199% tham số bằng LoRA trên 8.000 đoạn phim trò chơi, mô hình cho phép chuyển đổi hành động mượt mà theo từng khoảng thời gian ẩn của video. Nghiên cứu này chứng minh rằng việc điều khiển chính xác theo thời gian trong các mô hình thế giới video có thể đạt được mà không cần huấn luyện lại toàn bộ mô hình hay tiêu tốn tài nguyên tính toán khổng lồ. Điều này giúp việc tạo video tương tác, mô phỏng vật lý trò chơi và xây dựng môi trường ảo trở nên dễ tiếp cận hơn nhiều đối với cộng đồng phát triển nguồn mở. Bộ khung này chèn các lệnh hành động bằng văn bản trực tiếp qua đường truyền văn bản đã tinh chỉnh của MiniMax-H3, gán các câu lệnh hành động riêng biệt cho từng khoảng ẩn của video. Được huấn luyện qua 10.000 bước LoRA, H3-World cho thấy khả năng tổng quát hóa tốt đối với các kịch bản thị giác và sự kết hợp hành động mới.
## KIẾN THỨC NỀN
Mô hình thế giới video (video world model) nhằm mục đích tạo ra các chuỗi video nhất quán về mặt thị giác, đồng thời duy trì sự hiểu biết về vật lý không gian, logic camera và động lực học của vật thể theo thời gian. MiniMax-H3 là một mô hình nền tảng video đa thức mở có khả năng tạo ra video độ phân giải cao cùng âm thanh nổi nguyên bản từ các đầu vào đa phương thức.