~/LLM/deepseek-v4-flash-benchmarked-on-m2-ultra-mac-using-dwarfstar-inference-engine

Thử nghiệm hiệu năng DeepSeek-V4-Flash trên Mac M2 Ultra bằng DwarfStar

Một người dùng đã chia sẻ kết quả thử nghiệm hiệu năng khi chạy cục bộ mô hình DeepSeek-V4-Flash trên máy Mac M2 Ultra (192GB RAM) bằng công cụ DwarfStar. Cấu hình này đạt tốc độ giải mã (decode) từ 28 token mỗi giây (t/s) ở giai đoạn đầu và giảm xuống 18 t/s ở độ sâu ngữ cảnh lên tới 192k. Điều này chứng minh tính khả thi của việc chạy cục bộ các mô hình ngôn ngữ lớn như DeepSeek V4 Flash trên phần cứng tiêu dùng cao cấp như Apple Silicon. Nó cho thấy cách các công cụ suy luận chuyên dụng và kỹ thuật lượng tử hóa giúp việc thiết lập AI cục bộ quy mô lớn trở nên thực tế mà không cần phụ thuộc vào API đám mây. Thử nghiệm cho thấy tốc độ giải mã từ 18-28 t/s vẫn được duy trì ngay cả khi xuất ra 8k token ở các độ sâu ngữ cảnh khác nhau. DwarfStar đạt được điều này bằng cách sử dụng phương pháp lượng tử hóa chọn lọc để nén kích thước mô hình, giúp nó tương thích với các hệ thống Mac có bộ nhớ lớn.

## KIẾN THỨC NỀN

DwarfStar (ds4) là một công cụ suy luận viết bằng C gọn nhẹ, được thiết kế riêng để chạy các mô hình như DeepSeek V4 Flash và GLM 5.2 trên Metal, CUDA và ROCm. Quá trình suy luận của mô hình ngôn ngữ lớn (LLM) gồm hai giai đoạn chính: giai đoạn prefill (xử lý trước câu lệnh đầu vào để xây dựng bộ nhớ đệm KV) và giai đoạn decode (giải mã để tạo ra các token đầu ra một cách tuần tự).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Apple Silicon#Hardware Benchmarks#DeepSeek#Local AI

$ subscribe --daily

Thử nghiệm hiệu năng DeepSeek-V4-Flash trên Mac M2 Ultra bằng DwarfStar | Daily News