Hỗ trợ Minimax M3 với MSA đã được tích hợp vào llama.cpp
Hỗ trợ cho kiến trúc mô hình Minimax M3, sử dụng cơ chế Chú ý Thưa thớt MiniMax (MSA), đã chính thức được tích hợp vào kho lưu trữ mã nguồn llama.cpp. Sự tích hợp này cho phép người dùng chạy các mô hình Minimax M3 cục bộ bằng framework llama.cpp. Bản cập nhật này mở rộng danh sách các mô hình tiên tiến có thể chạy cục bộ trên phần cứng tiêu dùng, cho phép thực thi hiệu quả một mô hình có khả năng xử lý ngữ cảnh lên tới 1 triệu token. Điều này giúp giảm rào cản cho các nhà phát triển muốn triển khai riêng tư các mô hình lập trình và tác vụ tự động (agentic) hiệu năng cao. Minimax M3 sở hữu kiến trúc Chú ý Thưa thớt MiniMax (MSA) độc quyền được thiết kế để hỗ trợ các cửa sổ ngữ cảnh cực dài lên tới 1 triệu token. Việc tích hợp vào llama.cpp cho phép chuyển đổi sang định dạng GGUF và thực hiện suy luận lượng tử hóa cho các mô hình này.
## KIẾN THỨC NỀN
llama.cpp là một dự án mã nguồn mở được viết bằng C/C++ cho phép suy luận LLM hiệu năng cao trên nhiều loại phần cứng, bao gồm cả CPU và GPU cấp tiêu dùng. Minimax M3 là một mô hình đa phương thức được tối ưu hóa cho các tác vụ lập trình và quy trình tự động hóa. MSA (MiniMax Sparse Attention) là một cơ chế chú ý chuyên dụng giúp giảm độ phức tạp tính toán, giúp xử lý ngữ cảnh dài hiệu quả hơn.