Bản phát hành llama.cpp b10648 đơn giản hóa đồ thị mô hình MiniMax-01
Dự án llama.cpp đã phát hành phiên bản build b10648, giới thiệu một đồ thị tính toán được đơn giản hóa cho mô hình MiniMax-01. Bản cập nhật này nhằm tối ưu hóa đường dẫn thực thi của mô hình trong công cụ suy luận. Việc đơn giản hóa đồ thị tính toán trong llama.cpp có thể giúp tối ưu hóa hiệu suất bộ nhớ và tăng tốc độ suy luận cho MiniMax-01. Điều này cho phép các nhà phát triển chạy mô hình hiệu năng cao và quy mô lớn này hiệu quả hơn trên phần cứng cục bộ. Bản cập nhật này, được theo dõi theo PR #27790, nhắm mục tiêu cụ thể vào cấu trúc đồ thị của mô hình MiniMax-01. Các tệp thực thi của phiên bản này hiện có sẵn cho nhiều nền tảng bao gồm macOS, Windows (hỗ trợ CUDA 12/13), Linux và Android.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận LLM mã nguồn mở rất phổ biến, được thiết kế để chạy các mô hình cục bộ với cấu hình tối thiểu. MiniMax-01 là một dòng mô hình quy mô lớn sử dụng cơ chế Lightning Attention và kiến trúc Mixture of Experts (MoE), sở hữu tổng cộng 456 tỷ tham số với 45,9 tỷ tham số được kích hoạt cho mỗi token.