~/ARTIFICIAL I/xiaomi-previews-mimo-v2-6-ai-model-via-live-streamed-reinforcement-learning

Xiaomi xem trước mô hình AI MiMo-V2.6 thông qua phát trực tiếp quá trình huấn luyện

Nhóm MiMo của Xiaomi đã công bố kế hoạch phát hành mô hình MiMo-V2.6 và phát trực tiếp quá trình huấn luyện với chi phí tính toán đã vượt quá 1,25 triệu USD. Dưới sự dẫn dắt của Luo Fuli, nhóm đã dành 6 tháng nghiên cứu giới hạn mở rộng quy mô của học tăng cường trên các phương diện tính toán, môi trường Agent và chấm điểm. Việc phát trực tiếp công khai quá trình huấn luyện mô hình ngôn ngữ lớn và chia sẻ thông tin kỹ thuật về học tăng cường cho Agent mang lại tính minh bạch hiếm có trong phát triển AI tiên tiến. Nếu các phương pháp của Xiaomi thành công, chúng có thể cung cấp những kỹ thuật mở hiệu quả để huấn luyện các Agent suy luận. MiMo-V2.6 xử lý khoảng 2 tỷ token mỗi bước thông qua 1.568 câu lệnh (prompt) và 16 lần rollout trong kiến trúc hoàn toàn bất đồng bộ. Mô hình này giới thiệu kỹ thuật 'Agentic In-group Credit Assignment' và tăng cường tài nguyên tính toán dành cho quá trình chấm điểm để trao thưởng cho các chuỗi suy luận và sử dụng công cụ nhiều bước.

## KIẾN THỨC NỀN

Tinh chỉnh bằng học tăng cường (RL) phụ thuộc vào các mô hình thưởng hoặc bộ chấm điểm (grader) tự động để đánh giá đầu ra của mô hình và định hướng quá trình huấn luyện. Khái niệm phân bổ trách nhiệm (credit assignment) trong RL dành cho Agent là quá trình xác định bước đi hoặc lệnh gọi công cụ cụ thể nào trong một chuỗi tương tác dài đã đóng góp vào kết quả thành công hay thất bại cuối cùng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Artificial Intelligence#Reinforcement Learning#LLM#Open Source AI

$ subscribe --daily

Xiaomi xem trước mô hình AI MiMo-V2.6 thông qua phát trực tiếp quá trình huấn luyện | Daily News