Xiaomi Ra Mắt Kiến Trúc HySparse2 Cho MiMo-V3 Nhằm Tối Ưu Hiệu Suất Agent AI
Xiaomi đã công bố HySparse2, kiến trúc cốt lõi cho mô hình ngôn ngữ lớn MiMo-V3 sắp ra mắt, được thiết kế để tối ưu hóa việc suy luận cho các tác vụ AI agent đa lượt có ngữ cảnh dài. Thiết kế mới này giới thiệu cơ chế chia sẻ Key-Value (KV) hai cấp cùng khả năng chọn lọc thưa ở cấp độ token, cho phép giai đoạn tính toán prefill kết thúc sớm sau khi chỉ cần chạy một nửa số lớp đầu tiên của mô hình. Bằng cách giảm đáng kể gánh nặng tính toán và bộ nhớ khi xử lý lịch sử ngữ cảnh dài, HySparse2 giúp các AI agent xử lý kết quả công cụ, nhật ký mã nguồn và tài liệu một cách hiệu quả hơn nhiều. Ở độ dài ngữ cảnh 1 triệu token, HySparse2 giảm 5 lần lượng tính toán prefill và giảm dung lượng bộ nhớ KV cache từ 12 GB xuống còn 2.7 GB so với kiến trúc Hybrid SWA tiêu chuẩn. HySparse2 chia mạng thành hai phần là Self-Decoder và Cross-Decoder, tận dụng kỹ thuật KV Bridging để tạo toàn bộ KV cache cần thiết cho nửa sau của mô hình trực tiếp từ trạng thái ẩn của nửa đầu. Bên cạnh đó, mô hình chuyển từ chọn lọc theo khối sang chọn lọc thưa tinh xảo ở cấp độ token, duy trì bắt buộc cửa sổ trượt cục bộ 128 token kết hợp với 1.024 token toàn cục được chọn lọc.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn dựa vào cơ chế chú ý (attention mechanism) để tính toán mối quan hệ giữa các token đầu vào, tạo ra các tensor Key và Value (KV) được lưu trong bộ đệm KV cache để phục vụ việc sinh token nối tiếp. Trong các tác vụ ngữ cảnh dài, cơ chế chú ý toàn cục truyền thống đòi hỏi chi phí tính toán tăng theo bình phương và tiêu tốn lượng lớn bộ nhớ GPU để lưu giữ KV cache, khiến chi phí vận hành AI agent đa lượt trở nên rất tốn kém. Các thiết kế hỗn hợp như Chú ý cửa sổ trượt (SWA) và chú ý thưa (sparse attention) giúp giảm tải các điểm nghẽn này bằng cách giới hạn việc tính toán toàn cục chỉ ở một số lớp hoặc token nhất định.