~/LOCAL LLMS/portable-hardware-setup-for-running-27b-llm-locally-with-262k-context

Cấu hình phần cứng di động chạy LLM 27B cục bộ với ngữ cảnh 262K

Một người dùng Reddit đã chia sẻ cấu hình phần cứng di động tự dựng có khả năng chạy cục bộ mô hình LLM 27 tỷ tham số với độ dài ngữ cảnh lên tới 262K token ở định dạng BF16. Hệ thống này nằm gọn trong một hộp đựng kích thước tương đương hộp cơm trưa, đạt tốc độ prefill hơn 1.700 token/giây và tốc độ tạo token là 45 token/giây nhờ công nghệ Dự đoán đa token (MTP). Thử nghiệm này chứng minh rằng việc phân tích tài liệu và OCR độ chính xác cao với ngữ cảnh lớn có thể được thực hiện hoàn toàn ngoại tuyến trên phần cứng máy trạm di động. Đây là một giải pháp thay thế khả thi cho các API đám mây đối với các chuyên gia xử lý tài liệu pháp lý hoặc tài liệu nội bộ có tính bảo mật cao. Cấu hình này sử dụng bo mạch chủ Minisforum BD770i với CPU Ryzen 7745HX, 96GB RAM DDR5 và GPU máy trạm RTX Pro 6000 96GB được lắp trong vỏ case FormD T1. Người dùng đã sử dụng tham số `--mmproj` của llama.cpp để hỗ trợ đa phương thức và tối ưu hóa quá trình tạo văn bản bằng phương pháp lấy mẫu min-p nhằm duy trì độ chính xác.

## KIẾN THỨC NỀN

Việc chạy các mô hình ngôn ngữ lớn cục bộ đòi hỏi dung lượng VRAM rất lớn, đặc biệt là khi xử lý các cửa sổ ngữ cảnh khổng lồ để phân tích tài liệu. Dự đoán đa token (MTP) là kỹ thuật giúp tăng tốc độ suy luận bằng cách dự đoán nhiều token cùng lúc, trong khi lấy mẫu min-p lọc động các token có xác suất thấp để cải thiện tính mạch lạc của kết quả. Tham số `--mmproj` trong llama.cpp kích hoạt khả năng đa phương thức, cho phép mô hình xử lý cả văn bản và hình ảnh.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#Hardware#AI Inference#Edge Computing

$ subscribe --daily

Cấu hình phần cứng di động chạy LLM 27B cục bộ với ngữ cảnh 262K | Daily News