Tạo video đồ họa chuyển động bằng mã nguồn LLM thay vì mô hình khuếch tán video
Một người dùng Reddit đã trình diễn phương pháp tạo video mới bằng cách yêu cầu GLM 5.3 Flash sinh mã hoạt ảnh HTML5 Canvas có thể thực thi thay vì dựa vào các mô hình khuếch tán video AI truyền thống. Hệ thống được chạy qua vLLM và đã tạo ra một video đồ họa thông tin thị trường chứng khoán dài 40 giây dựa trên một bộ kỹ năng hoạt ảnh canvas vẽ tay. Phương pháp dựa trên mã nguồn này mang lại khả năng dựng hình chính xác, văn bản hiển thị rõ ràng và các thành phần thị giác sắc nét mà không gặp phải lỗi biến dạng ảnh hay chi phí suy luận cao như các mô hình khuếch tán video. Điều này cho thấy các LLM sinh mã có thể được khai thác để tự động hóa đồ họa chuyển động và sáng tạo nội dung thị giác. Quy trình làm việc dựa trên một bộ kỹ năng tùy chỉnh định nghĩa các quy tắc đồ họa Canvas vẽ tay, cho phép mô hình tự do tạo mã hoạt ảnh từ một câu lệnh tổng quát. Mô hình GLM được chạy ở định dạng định lượng 8-bit bằng công cụ suy luận vLLM trên hệ thống phần cứng gồm bốn máy chủ DGX.
## KIẾN THỨC NỀN
Tạo video bằng AI truyền thống thường dựa vào các mô hình khuếch tán để tổng hợp trực tiếp các khung hình điểm ảnh, vốn thường gặp khó khăn trong việc hiển thị chính xác văn bản, biểu đồ hoặc đồ họa toán học. Ngược lại, phương pháp sinh mã sử dụng các mô hình ngôn ngữ lớn (LLM) như dòng GLM của Zhipu AI để xuất các kịch bản vector hoặc mã JavaScript hiển thị mượt mà trên trình duyệt. Các công cụ suy luận hiệu năng cao như vLLM thường được sử dụng để thực thi các mô hình này một cách hiệu quả.