Công bố kiến trúc HySparse2 làm nền tảng cho mô hình MiMo-V3 sắp ra mắt
Nhóm nghiên cứu đứng sau chuỗi mô hình MiMo đã phát hành bài báo khoa học về HySparse2, một kiến trúc chú ý thưa kết hợp (hybrid sparse attention) được thiết kế làm khung nền tảng cho MiMo-V3. HySparse2 giới thiệu phương pháp tối ưu hóa mới cho các mạng thần kinh thưa tập trung vào cơ chế chia sẻ bộ nhớ đệm Key-Value (KV) hai cấp độ. Khi các mô hình ngôn ngữ lớn mở rộng để xử lý ngữ cảnh ngày càng dài, dung lượng bộ nhớ và chi phí tính toán cho cơ chế tự chú ý (self-attention) trở thành điểm nghẽn nghiêm trọng. HySparse2 mang lại một kiến trúc hiệu quả hơn đáng kể cho các mô hình suy luận ngữ cảnh dài bằng cách giảm thiểu chi phí bộ nhớ đệm KV và yêu cầu băng thông bộ nhớ. HySparse2 sở hữu cơ chế chia sẻ KV hai cấp độ: KV Bridging ở cấp bên ngoài (sử dụng cấu trúc self-decoder và cross-decoder kiểu YOCO để kết nối các lớp chú ý đầy đủ) và KV Reuse ở cấp bên trong (nơi các lớp chú ý thưa tái sử dụng bộ nhớ đệm KV cùng các chỉ số lựa chọn token từ lớp chú ý đầy đủ ngay trước đó).
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn tiêu chuẩn sử dụng cơ chế tự chú ý dày đặc (dense self-attention), lưu trữ các cặp Key-Value (KV) cho mọi token trên toàn bộ các lớp, làm tiêu tốn lượng lớn bộ nhớ GPU trong quá trình tạo văn bản. Các kiến trúc chú ý thưa (sparse attention) giảm thiểu yêu cầu này bằng cách chỉ tính toán chú ý trên một tập hợp con token mục tiêu, nhưng để đạt hiệu quả mà vẫn giữ nguyên độ chính xác ngữ cảnh đòi hỏi các chiến lược tái sử dụng bộ nhớ đệm KV tinh vi.