Xây dựng PC đa GPU 64GB VRAM cho kỹ thuật phần mềm AI cục bộ
Một kỹ sư phần mềm đã chia sẻ quá trình lắp ráp máy trạm đa GPU dung lượng 64GB VRAM để chạy cục bộ các trợ lý lập trình AI mã nguồn mở ở độ chính xác cao. Bài viết chi tiết hóa các giải pháp thực tế cho việc gắn GPU, giới hạn dây cáp nối dài PCIe 4.0, giới hạn bộ nguồn và các tham số biên dịch llama.cpp tùy chỉnh. Việc vận hành các trợ lý AI lập trình cục bộ mang lại sự riêng tư và độc lập khỏi các dịch vụ đám mây trả phí như OpenAI hay Anthropic. Bài viết cho thấy các giải pháp xoay xở phần cứng và tối ưu phần mềm cần thiết để nhà phát triển cá nhân có thể chạy LLM mã nguồn mở với ngữ cảnh lớn trên phần cứng phổ thông. Cấu hình sử dụng vỏ máy Fractal Meshify 2 XL chứa ba GPU (bao gồm các bản RTX 3090 FE được giới hạn công suất 300W) kết nối qua cáp ruy-băng PCIe 4.0 dài 500-600mm và giá treo đứng tùy chỉnh. Về phần mềm, hiệu năng được tối ưu bằng phiên bản llama.cpp tự biên dịch hỗ trợ chia tách tensor trên 3 GPU (`--tensor-split 14,24,24`) và kỹ thuật speculative drafting để xử lý cửa sổ ngữ cảnh lên tới 262.144 token.
## KIẾN THỨC NỀN
Các trợ lý AI kỹ thuật phần mềm (SWE agent) dựa vào các mô hình ngôn ngữ lớn (LLM) để phân tích mã nguồn và tạo code, đòi hỏi dung lượng bộ nhớ đồ họa (VRAM) rất lớn để chứa trọng số mô hình và bộ nhớ đệm KV mở rộng. Các kỹ thuật định lượng như GGUF giúp nén dung lượng mô hình để giảm mức tiêu thụ bộ nhớ, nhưng việc vận hành mô hình độ chính xác cao với cửa sổ ngữ cảnh lớn vẫn đòi hỏi cấu hình nhiều GPU.