XPeng Phân Phối XOS 6.3.0 Với Mô Hình VLA Thế Hệ 2 Về Mô Hình Thế Giới Trên Xe
XPeng đã chính thức bắt đầu phân phối bản cập nhật XOS 6.3.0, giới thiệu mô hình Vision-Language-Action (VLA) thế hệ thứ hai giúp chuyển đổi lái xe tự động từ nhận dạng không gian 3D sang hiểu biết thời-không 4D. Bản cập nhật tích hợp mô hình thế giới dự đoán X-Foresight có khả năng dự báo quỹ đạo giao thông trong 6 giây tới, cùng với phiên bản rút gọn VLA Lite dành cho các nền tảng phần cứng có năng lực tính toán thấp hơn. Việc triển khai các mô hình thời-không chuỗi dài và dự đoán thế giới trực tiếp trên thiết bị phần cứng của xe đánh dấu bước tiến quan trọng hướng tới tự lái cấp độ cao hơn (từ L2 đến L4). Việc XPeng ứng dụng nén token và chắt lọc mô hình (distillation) cũng cho thấy cách đưa các kiến trúc AI dung lượng lớn lên các dòng xe sản xuất hàng loạt bị giới hạn về phần cứng. Bản cập nhật giới thiệu kiến trúc ngữ cảnh dài Infini-VLA, giúp ghi nhớ 30 giây dữ liệu lịch sử để đưa ra quyết định lái xe. Ngoài ra, XPeng đã áp dụng kỹ thuật nén token và chắt lọc mô hình để triển khai phiên bản Turing VLA 2.0 Lite lên các cấu hình xe chỉ trang bị một chip Turing mà không làm giảm khả năng hiểu thị giác.
## KIẾN THỨC NỀN
Trong lĩnh vực lái xe tự động, các mô hình Vision-Language-Action (VLA) kết hợp nhận thức thị giác, suy luận ngôn ngữ tự nhiên và lập kế hoạch hành động thành một hệ thống AI đầu-cuối (end-to-end). Mô hình thế giới (world model) mô phỏng thực tại vật lý để dự đoán sự thay đổi của môi trường, trong khi chắt lọc mô hình (model distillation) chuyển giao tri thức từ mô hình lớn sang mô hình nhỏ hơn để chạy hiệu quả trên phần cứng của xe.