Xiaomi công bố kiến trúc cốt lõi HySparse 2 cho mô hình MiMo-V3
Luo Fuli, trưởng nhóm mô hình lớn MiMo của Xiaomi, đã công bố HySparse 2, kiến trúc cốt lõi mới cho mô hình MiMo-V3 sắp ra mắt. Được thiết kế cho các tác vụ ngữ cảnh dài và AI agent, HySparse 2 giúp giảm 5,02 lần chi phí tính toán prefill (FLOPs) và giảm 4,5 lần dung lượng bộ nhớ KV cache ở độ dài ngữ cảnh 1 triệu token. Khi các luồng công việc AI agent tích lũy lịch sử ngữ cảnh khổng lồ qua nhiều lượt tương tác công cụ, độ trễ prefill và giới hạn bộ nhớ sẽ hạn chế nghiêm trọng khả năng triển khai thực tế. Bằng cách giảm mạnh nhu cầu tài nguyên cho các ngữ cảnh triệu token, HySparse 2 giúp việc thực thi lý luận ngữ cảnh dài và các tác vụ AI agent phức tạp trở nên nhanh hơn và tiết kiệm chi phí hơn nhiều. HySparse 2 phát triển trên cấu trúc decoder-decoder lấy cảm hứng từ YOCO sử dụng cơ chế KV Bridging và KV Reuse, cho phép lựa chọn thưa ở cấp độ token và giúp tính toán prefill thoát sớm ngay khi self-decoder hoàn thành. Kết quả thử nghiệm cho thấy điểm số cao hơn trên các bộ kiểm thử RULER-v2 và MRCRv2 cùng với chỉ số độ hỗn loạn AgentPPL và LongPPL được cải thiện (thấp hơn).
## KIẾN THỨC NỀN
Trong các mô hình ngôn ngữ lớn dựa trên Transformer, bộ đệm Key-Value (KV cache) lưu trữ các trạng thái token trước đó để đẩy nhanh quá trình sinh văn bản, nhưng mức tiêu thụ bộ nhớ của nó tăng tuyến tính theo độ dài câu lệnh. Các kiến trúc như YOCO ("You Only Cache Once") giải quyết vấn đề này bằng thiết kế decoder tách biệt, trong đó các lớp cross-decoder tái sử dụng trạng thái từ self-decoder, giúp tiết kiệm bộ nhớ KV và cho phép quá trình prefill dừng sớm.