XPeng Sắp Ra Mắt Mô Hình VLA Thế Hệ Thứ Hai Cho Tự Lái Vào Tháng 9
XPeng thông báo sẽ triển khai phiên bản mới của mô hình Vision-Language-Action (VLA) thế hệ thứ hai cho các dòng xe Ultra và Ultra SE vào tháng 9, cùng với phiên bản rút gọn "Lite" dành cho các nền tảng có hiệu năng tính toán thấp hơn. Bản cập nhật này giới thiệu mô hình thế giới dự đoán X-Foresight và kiến trúc ngữ cảnh dài Infini-VLA. Việc triển khai này đánh dấu một ứng dụng thực tế quan trọng của AI đa phương thức tiên tiến trên các dòng xe thương mại, giúp kết nối khả năng tự lái từ L2 đến L4. Bằng cách sử dụng phương pháp chưng cất mô hình (model distillation), XPeng chứng minh cách tối ưu hóa các mô hình AI cao cấp để vận hành trực tiếp trên các phương tiện có hiệu năng tính toán hạn chế. Mô hình VLA mới sử dụng công nghệ nén token để duy trì khả năng hiểu thị giác với ít token hơn, trong khi mô hình X-Foresight có thể dự đoán hành vi giao thông trước 6 giây. Ngoài ra, kiến trúc Infini-VLA duy trì một cửa sổ bộ nhớ kéo dài 30 giây về môi trường xung quanh để cải thiện các quyết định lái xe.
## KIẾN THỨC NỀN
Mô hình Vision-Language-Action (VLA) là một AI đa phương thức xử lý dữ liệu đầu vào dạng hình ảnh và chỉ dẫn để trực tiếp đưa ra các hành động điều khiển. Trong lĩnh vực tự lái, các mô hình thế giới (world models) được sử dụng để dự đoán và mô phỏng các tình huống giao thông trong tương lai, giúp phương tiện đưa ra quyết định an toàn hơn bằng cách lường trước hành vi của các phương tiện khác.