VLX-Seek-1.5-10B: Mô hình ngôn ngữ - thị giác 10B cho AI hiện thân
Mô hình ngôn ngữ - thị giác mã nguồn mở VLX-Seek-1.5-10B đã được phát hành, được thiết kế để cải thiện khả năng định vị trực quan trong AI hiện thân. Thay vì tạo ra các tọa độ thô, mô hình này định nghĩa lại việc định vị dưới dạng truy xuất và tham chiếu vùng bằng cách chuyển đổi các vùng ứng viên thành các token ngôn ngữ có thể định địa chỉ. Phương pháp này giúp đồng bộ hóa việc định vị với thế mạnh lập luận và lựa chọn của các mô hình ngôn ngữ, khiến nó rất phù hợp cho robot biên, thiết bị bay không người lái (drone) và hệ thống giám sát. Bằng cách tránh việc tạo chuỗi tọa độ dễ lỗi, mô hình cung cấp các điểm neo cấp vùng ổn định hơn cho các tác nhân AI vật lý. Mô hình sở hữu tính năng tạo mạng đề xuất đối tượng (OPN) nhanh hơn, các lớp attention tuyến tính để suy luận hiệu quả và cơ chế từ chối mục tiêu vắng mặt rõ ràng nhằm giảm thiểu ảo giác. Tuy nhiên, nó phụ thuộc nhiều vào chất lượng của các đề xuất vùng ứng viên và yêu cầu một quy trình hậu xử lý để ánh xạ các token trở lại tọa độ hình ảnh.
## KIẾN THỨC NỀN
Định vị trực quan (visual grounding) là quá trình liên kết các mô tả văn bản với các vùng hoặc đối tượng cụ thể trong một hình ảnh. AI hiện thân (Embodied AI) đề cập đến các hệ thống trí tuệ nhân tạo, như robot hoặc drone, tương tác vật lý với môi trường của chúng, đòi hỏi khả năng lập luận không gian chính xác và nhận thức thị giác theo thời gian thực để thực hiện các nhiệm vụ.