~/LOCAL LLMS/budget-friendly-local-llm-setup-using-amd-radeon-780m-igpu-and-64gb

Cấu hình LLM cục bộ giá rẻ dùng iGPU AMD Radeon 780m và 64GB RAM

Một cấu hình phần cứng giá rẻ sử dụng mini PC với iGPU AMD Radeon 780m và 64GB RAM DDR5 đã được chứng minh là có thể chạy các mô hình ngôn ngữ lớn như Qwen 35B. Bằng cách cấu hình các tham số nhân Linux cụ thể, người dùng có thể phân bổ tối đa 48GB bộ nhớ hệ thống làm VRAM để tăng tốc suy luận bằng GPU. Phương pháp này mang lại một giải pháp thay thế tiết kiệm chi phí (dưới 1000 EUR) so với các GPU chuyên dụng đắt tiền để chạy các mô hình AI cục bộ lớn. Nó giúp bình dân hóa việc tiếp cận suy luận LLM cục bộ bằng cách tận dụng các máy mini PC phổ thông và bộ nhớ hệ thống chia sẻ. Cấu hình này đạt tốc độ khoảng 21 token mỗi giây trên mô hình Qwen 35B (lượng tử hóa Q8) bằng cách sử dụng llama.cpp với backend Vulkan. Các tham số nhân Linux chính được sử dụng để mở rộng dung lượng VRAM bao gồm amdgpu.gttsize=49152, amd_iommu=off và ttm.pages_limit=16777216.

## KIẾN THỨC NỀN

Các GPU tích hợp (iGPU) như Radeon 780m chia sẻ RAM hệ thống với CPU thay vì có VRAM chuyên dụng riêng. Theo mặc định, các hệ điều hành giới hạn lượng RAM hệ thống có thể phân bổ cho iGPU, nhưng các tham số nhân Linux như amdgpu.gttsize cho phép người dùng ghi đè các giới hạn này. Llama.cpp là một công cụ suy luận mã nguồn mở phổ biến được tối ưu hóa để chạy các LLM cục bộ trên phần cứng tiêu dùng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#Hardware#AMD Radeon#Llama.cpp#Edge AI

$ subscribe --daily

Cấu hình LLM cục bộ giá rẻ dùng iGPU AMD Radeon 780m và 64GB RAM | Daily News