~/LLAMA CPP/llama-cpp-adds-gpu-cache-for-moe-experts-stored-in-host-memory

llama.cpp Thêm Bộ Nhớ Đệm GPU Cho Các Expert MoE Lưu Trên RAM Host

Một yêu cầu kéo (PR #29887) mới trong llama.cpp đã bổ sung cơ chế bộ nhớ đệm (cache) trên GPU cho các mô hình Mixture of Experts (MoE) có trọng số expert được đẩy sang RAM hệ thống. Điều này cho phép lưu trữ các expert được kích hoạt thường xuyên ngay trên VRAM, giúp tăng tốc đáng kể tốc độ suy luận trên các hệ thống có dung lượng bộ nhớ GPU hạn chế. Việc chạy các mô hình MoE lớn trước đây đòi hỏi dung lượng VRAM rất lớn hoặc bị suy giảm hiệu năng nghiêm trọng khi chuyển bớt các expert sang RAM máy tính do nút thắt băng thông PCIe. Bằng cách lưu trữ tạm các expert đang hoạt động trong VRAM, người dùng AI địa phương có thể đạt tốc độ tạo token nhanh hơn nhiều trên phần cứng phổ thông. Tối ưu hóa này tự động quản lý VRAM GPU để giữ các mạng con (expert) được sử dụng gần đây hoặc thường xuyên ngay trên card đồ họa, tránh việc truyền dữ liệu lặp đi lặp lại qua bus kết nối giữa CPU và GPU. Chiến lược này giúp giảm thiểu nút thắt độ trễ trong quá trình tạo chuỗi token khi các token liên tiếp được điều hướng đến cùng một nhóm expert.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc LLM thay thế các lớp feed-forward lớn bằng nhiều mạng con 'expert' nhỏ hơn, giúp điều hướng mỗi token đầu vào chỉ đến một nhóm nhỏ các expert. Mặc dù các mô hình MoE mang lại hiệu quả cao, tổng số lượng tham số khổng lồ của chúng đòi hỏi dung lượng bộ nhớ lớn, thường buộc người dùng phải đẩy các expert chưa dùng đến sang bộ nhớ RAM hệ thống chậm hơn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#MoE#LLM Inference#GPU Cache#Open Source AI

$ subscribe --daily

llama.cpp Thêm Bộ Nhớ Đệm GPU Cho Các Expert MoE Lưu Trên RAM Host | Daily News