~/ROBOTICS/unitree-releases-unifolm-wla-1-0-a-6b-model-for-humanoid-whole

Unitree ra mắt UnifoLM-WLA-1.0: Mô hình 6B điều khiển toàn thân cho robot hình người

Unitree Robotics vừa phát hành UnifoLM-WLA-1.0, một mô hình nền tảng đa năng 6 tỷ tham số dành cho robot hình người, được huấn luyện trên khoảng 2.500 giờ dữ liệu robot thực tế. Mô hình duy nhất này hợp nhất khả năng điều khiển toàn thân và thao tác trên mặt bàn để hoàn thành 64 tác vụ vật lý khác nhau trên các nền tảng robot hình người như Unitree G1. Đợt phát hành này đánh dấu một bước tiến quan trọng trong AI nhập thể (embodied AI) khi chứng minh một mô hình duy nhất có thể đảm nhận cả lý luận không gian cấp cao lẫn điều khiển mượt mà toàn thân trên nhiều loại bàn tay robot khác nhau. Thành tựu này đưa robot hình người mã nguồn mở tiến gần hơn đến khả năng tự động hóa đa năng thay vì các hệ thống điều khiển đơn tác vụ rời rạc. Xây dựng dựa trên bộ lý luận nhập thể UnifoLM-ER-1 (phát triển từ Qwen3-VL), mô hình kết hợp dòng quang (optical flow) và VQ-VAE để dự đoán vùng động lực học cùng với Residual Vector Quantization để rời rạc hóa hành động. Một lớp chuyên gia hành động Multimodal Diffusion Transformer (MMDiT) sau đó được tích hợp để tạo ra tín hiệu điều khiển liên tục cho chuyển động thân dưới, cánh tay và các bàn tay khéo léo.

## KIẾN THỨC NỀN

Mô hình Vision-Language-Action (VLA) là các mạng nền tảng đa thức tiếp nhận quan sát hình ảnh và chỉ dẫn bằng văn bản để xuất ra trực tiếp các hành động điều khiển robot vật lý. Trước đây, robot hình người dựa vào các hệ điều khiển riêng biệt cho việc giữ thăng bằng, di chuyển và thao tác với đồ vật, khiến việc kết hợp thực thi tác vụ đa năng vào một mô hình duy nhất trở nên khó khăn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Robotics#Embodied AI#VLA Models#Computer Vision#Multimodal AI

$ subscribe --daily

Unitree ra mắt UnifoLM-WLA-1.0: Mô hình 6B điều khiển toàn thân cho robot hình người | Daily News