XPeng công bố mô hình VLA thế hệ thứ hai với khả năng hiểu thời gian 4D
XPeng đã ra mắt mô hình Vision-Language-Action (VLA) thế hệ thứ hai, chuyển đổi từ nhận thức không gian 3D sang hiểu biết thời gian-không gian 4D bằng cách tích hợp chiều thời gian. Mô hình cập nhật này sở hữu kiến trúc chuỗi dài "Infini-VLA", cho phép ghi nhớ bối cảnh lái xe của 30 giây trước đó. Bằng cách kết hợp bối cảnh thời gian và tăng tốc độ phản hồi đầu-cuối lên 300%, bản nâng cấp này cho phép xe tự hành đưa ra quyết định nhanh hơn, an toàn hơn và liên tục hơn trong môi trường thực tế đầy biến động. Đây là một bước tiến quan trọng trong lĩnh vực AI vật lý (Physical AI), nơi các mô hình phải nhận thức và hành động theo thời gian thực thay vì xử lý các khung hình tĩnh. Mô hình VLA thế hệ thứ hai sử dụng phương pháp suy luận tự hồi quy dạng luồng (streaming autoregressive inference) để xử lý song song quá trình nhận thức, tư duy và hành động. Tuy nhiên, kích thước mô hình lớn hơn và bối cảnh thời gian dài hơn đòi hỏi sức mạnh tính toán cao hơn đáng kể để duy trì sự an toàn trong thời gian thực.
## KIẾN THỨC NỀN
Mô hình Vision-Language-Action (VLA) là một AI đa phương thức tích hợp đầu vào hình ảnh và hướng dẫn ngôn ngữ để trực tiếp tạo ra các hành động vật lý cho robot hoặc hệ thống tự hành. AI vật lý (Physical AI) đề cập đến các hệ thống tương tác với thế giới thực thông qua cảm biến và bộ truyền động, khác biệt với AI tạo sinh thuần kỹ thuật số.