Alibaba mở mã nguồn Qwen-Drive-1.0-4B: Mô hình thị giác-ngôn ngữ cho tự lái
Nhóm Qwen của Alibaba đã mở mã nguồn Qwen-Drive-1.0-4B, mô hình nền tảng thị giác-ngôn ngữ 4 tỷ tham số được thiết kế dành riêng cho xe tự lái. Được phát triển dựa trên Qwen3.5-4B, mô hình hợp nhất khả năng nhận thức 3D, trả lời câu hỏi thị giác và lập kế hoạch chuyển động trong cùng một kiến trúc VLM. Đây là mô hình nền tảng thị giác-ngôn ngữ đầu tiên dành riêng cho xe tự lái mà vẫn duy trì khả năng hiểu thị giác và tuân thủ lệnh tổng quát. Bằng việc công khai trọng số và mã nguồn trên GitHub và Hugging Face, Alibaba giúp giảm rào cản nghiên cứu AI end-to-end trong công nghệ xe tự lái. Qwen-Drive-1.0 sử dụng quy trình huấn luyện phân đoạn kết hợp dữ liệu giám sát lái xe với dữ liệu VLM tổng hợp, cung cấp cả phiên bản chuyên gia SFT và RL. Dù phiên bản tinh chỉnh RL chấp nhận một chút sai số dịch chuyển vòng lặp mở, nó mang lại sự cải thiện lớn về độ an toàn trong mô phỏng vòng lặp kín và sự căn chỉnh theo sở thích lái xe của con người.
## KIẾN THỨC NỀN
Các hệ thống xe tự lái truyền thống thường tách biệt nhận thức, dự đoán và điều khiển thành các luồng xử lý độc lập. Việc đánh giá các hệ thống này bao gồm kiểm thử vòng lặp mở (đánh giá độ chính xác của quỹ đạo so với dữ liệu lái xe thực tế của con người) và mô phỏng vòng lặp kín hoặc giả vòng lặp kín (kiểm thử cách mô hình tương tác liên tục với môi trường phản ứng động).