XPeng Thử Nghiệm Xe Không Người Lái Với Mô Hình VLA Thế Hệ Hai Hợp Nhất L2-L4
XPeng Motors đã bước vào giai đoạn thử nghiệm thực tế không người lái tại Quảng Châu cho Robotaxi của mình, đồng thời công bố mô hình Vision-Language-Action (VLA) thế hệ thứ hai đã hợp nhất các cấp độ tự hành từ L2 đến L4. Mô hình này cũng có thể được chưng cất thành phiên bản nhẹ hơn (Turing VLA 2.0 Lite) để chạy trên các nền tảng phần cứng có hiệu năng tính toán thấp hơn. Bước tiến này cho thấy cách các mô hình nền tảng AI vật lý có thể kết nối giữa hệ thống hỗ trợ lái xe thương mại (L2) và Robotaxi tự hành hoàn toàn (L4). Bằng cách triển khai các phiên bản chưng cất của một mô hình thống nhất, XPeng có thể mở rộng khả năng tự hành tiên tiến lên nhiều dòng xe sản xuất hàng loạt hơn. Mô hình VLA thế hệ thứ hai đạt được khả năng hiểu thị giác chất lượng cao với ít token hơn thông qua phương pháp nén token học máy và huấn luyện chưng cất, giúp bảo toàn dung lượng mô hình trong khi giảm tải chi phí tính toán. Điều này cho phép mô hình khái quát hóa trên phạm vi toàn cầu và thích ứng với các nền tảng có cấu hình tính toán thấp hơn.
## KIẾN THỨC NỀN
Mô hình Vision-Language-Action (VLA) là một mô hình nền tảng đa phương thức giúp dịch các dữ liệu đầu vào dạng hình ảnh và chỉ dẫn trực tiếp thành các hành động vật lý. AI vật lý (Physical AI) đề cập đến các hệ thống trí tuệ nhân tạo, như xe tự hành và robot, tương tác trực tiếp với thế giới vật lý. Các cấp độ tự hành dao động từ L2 (tự động hóa một phần yêu cầu người lái giám sát) đến L4 (tự động hóa cao độ khi xe có thể tự lái trong các điều kiện cụ thể).