~/LLAMA CPP/llama-cpp-adds-support-for-nvidia-s-nemotron-3-puzzle-75b-hybrid

llama.cpp Hỗ Trợ Mô Hình Lai Nemotron-3-Puzzle-75B Của NVIDIA

Pull Request #25444 trên llama.cpp đã chính thức thêm khả năng hỗ trợ cho mô hình Nemotron-3-Puzzle-75B-A9B của NVIDIA, một kiến trúc lai hợp nhất Mamba, Mixture-of-Experts (MoE) và các lớp Attention. Cập nhật này cho phép thực thi cục bộ mô hình nén có tổng cộng 75,3 tỷ tham số với 9,3 tỷ tham số kích hoạt mỗi token. Cập nhật này mở rộng khả năng của llama.cpp trong việc xử lý các kiến trúc mạng nơ-ron lai phức tạp, không đồng nhất ngay trên phần cứng cá nhân. Điều này đưa mô hình nén 75B của NVIDIA đến với các công cụ suy luận mã nguồn mở mà không cần hạ tầng máy chủ đắt đỏ. Để đáp ứng thiết kế không đồng nhất trên 40 lớp MoE của Puzzle-75B, llama.cpp đã được nâng cấp để hỗ trợ kích thước FFN chuyên gia và số lượng expert top-k theo từng lớp thông qua cơ chế tải mảng metadata GGUF. Cập nhật cũng hỗ trợ phân tích cấu hình các khối phụ Multi-Token Prediction (MTP).

## KIẾN THỨC NỀN

Mamba là một kiến trúc mạng nơ-ron dựa trên State Space Model (SSM), giúp xử lý ngữ cảnh dài với độ phức tạp tuyến tính thay vì tăng theo hàm bình phương như cơ chế Attention truyền thống. Mixture-of-Experts (MoE) định tuyến dữ liệu đầu vào đến một nhóm nhỏ các mạng chuyên gia để giảm chi phí tính toán. Việc kết hợp Mamba, MoE và Attention giúp các mô hình lai như Nemotron-3 đạt hiệu năng cao nhưng vẫn tiết kiệm tài nguyên khi suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#MoE#Mamba#Open-Source-AI#LLM-Inference

$ subscribe --daily

llama.cpp Hỗ Trợ Mô Hình Lai Nemotron-3-Puzzle-75B Của NVIDIA | Daily News