Nhà phát triển xây dựng mô phỏng parkour cục bộ dùng mô hình GLM lượng hóa trên vLLM
Một nhà phát triển đã tạo ra mô phỏng parkour chạy hoàn toàn cục bộ, sử dụng mô hình GLM 5.3 Flash được lượng hóa chuẩn NVFP4 và vận hành trên 2 GPU DGX Spark qua vLLM. Cấu hình này đạt tốc độ prefill khoảng 1.500 token/giây và tốc độ decode 40 token/giây trên cửa sổ ngữ cảnh rộng. Dự án này chứng minh tính khả thi của việc chạy các luồng công việc LLM phức tạp về không gian 3D và tạo mã nguồn hoàn toàn cục bộ mà không cần phụ thuộc vào dịch vụ đám mây. Nó cho thấy việc kết hợp lượng hóa 4-bit với kỹ thuật song song hóa tensor đa GPU giúp mang lại hiệu suất AI cao cho các hệ thống máy chủ cá nhân. Cấu hình triển khai sử dụng vLLM với cơ chế song song hóa Tensor (TP=2), tích hợp với Claude Code làm khung đại lý điều khiển trên dung lượng ngữ cảnh 260k token. Tác giả ghi nhận khả năng thị giác và hiểu không gian 3D ấn tượng cùng tốc độ phản hồi tương tác mượt mà, đồng thời đã chia sẻ công thức cấu hình trên GitHub.
## KIẾN THỨC NỀN
Quá trình suy luận của LLM chia làm hai giai đoạn: prefill (xử lý song song câu lệnh đầu vào để tạo bộ nhớ đệm KV cache) và decode (sinh nối tiếp từng token đầu ra). Các kỹ thuật như lượng hóa NVFP4 giúp nén trọng số mô hình xuống dạng số thực 4-bit để tiết kiệm bộ nhớ, trong khi kỹ thuật song song hóa tensor chia nhỏ các lớp mô hình trên nhiều GPU nhằm tăng tốc độ tính toán và băng thông bộ nhớ.