~/AI ML/deepseek-releases-deepseek-v4-1-flash-multimodal-moe-model

DeepSeek chính thức phát hành mô hình MoE đa phương thức DeepSeek V4.1 Flash

DeepSeek đã chính thức ra mắt DeepSeek V4.1 Flash, một mô hình Mixture-of-Experts (MoE) đa phương thức 552 tỉ tham số dựa trên kiến trúc Causal-Encoder-Decoder bất đối xứng mới. Mô hình chỉ kích hoạt 8 tỉ tham số khi xử lý đầu vào và 16 tỉ tham số khi tạo đầu ra, giúp đạt hiệu suất cao với chi phí tính toán thấp. Nhờ nén mạnh dung lượng KV cache—giảm nhu cầu HBM xuống 1/4 và SSD xuống 1/8 so với thế hệ trước—mô hình giúp hạ đáng kể chi phí API cho các tác vụ ngữ cảnh dài và tác vụ dạng agent. Kết quả benchmark cho thấy V4.1 Flash vượt trội so với mô hình cờ đầu V4 Pro thế hệ trước, giúp DeepSeek hạ giá API và lên kế hoạch ngưng hỗ trợ V4 Pro. Trọng số mở và báo cáo kỹ thuật của mô hình đã được phát hành trên Hugging Face, mặc dù việc tự triển khai quy mô lớn đòi hỏi hạ tầng phần cứng rất lớn như cụm 2k GPU. DeepSeek cũng áp dụng khung giá API mới theo khung giờ cao điểm và thấp điểm, trong đó giờ thấp điểm có giá giảm một nửa.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là kiến trúc định tuyến đầu vào đến các mạng con chuyên biệt, cho phép mở rộng số lượng tham số của mô hình mà không làm tăng chi phí tính toán trên mỗi token theo tỷ lệ thuận. Kỹ thuật KV cache giúp lưu trữ các đại diện token đã xử lý vào bộ nhớ để tăng tốc quá trình suy luận, nhưng các tác vụ ngữ cảnh dài có thể tiêu tốn dung lượng bộ nhớ băng thông cao (HBM) rất lớn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#LLM#DeepSeek#MoE#Multimodal

$ subscribe --daily