Tranh luận về tính khả thi khi tái tạo mức giá API của DeepSeek V4 Flash trên GPU thuê
Một cuộc thảo luận kỹ thuật đã nổ ra trên Reddit nhằm nghi ngờ các tuyên bố cho rằng nhà phát triển có thể tái tạo mức giá API cực thấp của DeepSeek V4 Flash một cách có lãi bằng cách sử dụng GPU thuê hoặc tự vận hành. Người dùng đang đo điểm hiệu năng hệ thống của họ bằng khung giải mã suy đoán DSpark của DeepSeek để phân tích tính kinh tế của việc tự lưu trữ. Việc hiểu rõ tính kinh tế của việc lưu trữ LLM giúp các nhà phát triển đưa ra quyết định sáng suốt giữa việc sử dụng API thương mại và tự lưu trữ. Điều này làm nổi bật hiệu quả chi phí cực cao từ cơ sở hạ tầng của DeepSeek và những thách thức khi muốn đạt được mức giá tương đương trên phần cứng đám mây đi thuê. Một người dùng đo hiệu năng hệ thống GPU kép kích hoạt DSpark nhận thấy rằng mặc dù chi phí token đầu vào ($0,0082–$0,0089 trên mỗi triệu token) rẻ hơn API, nhưng chi phí token đầu ra ($0,32–$0,39 trên mỗi triệu token) đã vượt quá giá API của DeepSeek, ngay cả khi chưa tính đến khấu hao phần cứng.
## KIẾN THỨC NỀN
DeepSeek V4 Flash là một mô hình Mixture-of-Experts (MoE) tối ưu hóa hiệu năng, được thiết kế để suy luận với thông lượng cao và chi phí thấp. Để đạt tốc độ cao, mô hình này sử dụng DSpark, một khung giải mã suy đoán do DeepSeek phát triển giúp tăng tốc độ suy luận từ 60-85%.