~/AI ML/xiaomi-releases-open-weights-mimo-v2-6-distillation-model-based-on-qwen

Xiaomi phát hành mô hình MiMo-V2.6 tri thức chắt lọc dựa trên kiến trúc Qwen 9B

Xiaomi đã phát hành mô hình MiMo-V2.6-Distill-Qwen-9B trên Hugging Face, một mô hình ngôn ngữ trọng số mở được tạo ra bằng cách tri thức chắt lọc (distillation) từ kiến trúc MiMo-V2.6 sang nền tảng Qwen 9 tỷ tham số. Việc tri thức chắt lọc các mô hình nền tảng lớn thành kiến trúc 9B nhỏ gọn giúp người dùng LLM cục bộ và thiết bị có phần cứng hạn chế tiếp cận các năng lực AI nâng cao. Điều này nhấn mạnh xu hướng ngày càng tăng của ngành công nghệ khi các tập đoàn lớn chia sẻ trọng số mở để thúc đẩy việc ứng dụng AI tại chỗ. Đợt phát hành này sử dụng cấu trúc mô hình Qwen 9B phổ biến của Alibaba làm mạng học sinh, được huấn luyện từ dữ liệu của mô hình giáo viên chủ lực MiMo-V2.6 từ Xiaomi. Mô hình trọng số mở này hiện đã có thể tải về và chạy cục bộ thông qua repository của XiaomiMiMo trên Hugging Face.

## KIẾN THỨC NỀN

Tri thức chắt lọc (Knowledge Distillation) trong LLM là kỹ thuật nén mô hình, trong đó một mô hình 'học sinh' nhỏ hơn được huấn luyện để tái tạo hiệu suất và khả năng tư duy của mô hình 'giáo viên' lớn hơn nhiều. Dòng MiMo-V2.6 của Xiaomi bao gồm các mô hình lớn như MiMo-V2.6-Pro (trên 1 nghìn tỷ tham số) và MiMo-V2.6-Flash (309 tỷ tham số). Qwen là dòng mô hình nền tảng trọng số mở phổ biến do Alibaba phát triển, nổi tiếng với điểm số benchmark cao về tư duy và lập trình.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#LLM#Model Distillation#Open Source AI#LocalLLaMA

$ subscribe --daily

Xiaomi phát hành mô hình MiMo-V2.6 tri thức chắt lọc dựa trên kiến trúc Qwen 9B | Daily News