XPeng Ra Mắt Mô Hình VLA Thế Hệ Hai Và Siêu Trợ Lý Master Agent
XPeng đã nâng cấp mô hình Vision-Language-Action (VLA) thế hệ thứ hai và giới thiệu "Master Agent", tích hợp VLA và VLM (Vision-Language Model) để tái cấu trúc bộ não của xe. Hệ thống này cho phép xe hiểu được các ý định phức tạp của người dùng và thực hiện các hành động vật lý, chẳng hạn như tấp vào lề đường bằng lệnh giọng nói. Việc triển khai này đánh dấu một cột mốc quan trọng trong lĩnh vực AI hiện thân (Embodied AI), thu hẹp khoảng cách giữa khả năng lập luận của mô hình ngôn ngữ lớn và việc điều khiển xe vật lý trong thế giới thực. Bằng cách điều phối các hệ thống lái, khoang lái và khung gầm, công nghệ này đưa xe tự hành đến gần hơn với khả năng tương tác và thực thi trực quan giống như con người. Được xây dựng trên mô hình đa phương thức Omni tự phát triển của XPeng, Master Agent có thể phân tách các yêu cầu mơ hồ của người dùng thành các nhiệm vụ cụ thể và điều phối các tác tử dọc (vertical agents) phụ trách lái xe, khung gầm, khoang lái và thân xe. Ví dụ, hệ thống có thể định vị điểm đến dựa trên mô tả mơ hồ về một cửa hàng và lập kế hoạch lộ trình tương ứng.
## KIẾN THỨC NỀN
Mô hình Vision-Language-Action (VLA) là một mô hình nền tảng đa phương thức tích hợp khả năng nhận thức thị giác, hiểu ngôn ngữ tự nhiên và tạo ra các hành động vật lý. AI hiện thân (Embodied AI) đề cập đến trí tuệ nhân tạo tương tác trực tiếp với thế giới vật lý thông qua các cảm biến và bộ truyền động, chuyển đổi AI từ suy luận kỹ thuật số thuần túy sang thực thi vật lý.