~/DEEPSEEK/deepseek-v4-1-flash-launches-on-china-s-national-supercomputing-internet

DeepSeek V4.1 Flash Ra Mắt Trên Nền Tảng Siêu Máy Tính Quốc Gia Trung Quốc

DeepSeek V4.1 Flash, một mô hình Mixture-of-Experts (MoE) 552 tỷ tham số, đã chính thức ra mắt trên nền tảng Mạng lưới Siêu máy tính Quốc gia Trung Quốc thông qua truy cập API. Sở hữu kiến trúc Causal-Encoder-Decoder bất đối xứng mới, mô hình này vượt qua các mô hình cờ đầu trước đó như DeepSeek V4 Pro trong các bài kiểm tra hiệu năng. Bằng cách nén mạnh mẽ nhu cầu bộ nhớ KV Cache—giảm 75% dung lượng HBM và 87,5% dung lượng SSD—mô hình giúp giảm chi phí suy luận (inference) một cách đáng kể cho các tác vụ AI Agent tiêu tốn bộ nhớ. Đột phá kiến trúc này mang lại giải pháp hiệu quả về chi phí hơn nhiều cho việc triển khai các LLM quy mô lớn trong môi trường thực tế. Kiến trúc này sử dụng các mức kích hoạt đầu vào và đầu ra bất đối xứng, chỉ dùng 8 tỷ tham số kích hoạt cho đầu vào và 16 tỷ cho đầu ra nhằm giữ chi phí vận hành ở mức thấp. Mô hình đạt được năng lực nâng cao nhờ các kỹ thuật tiền huấn luyện mới kết hợp với quá trình hậu huấn luyện bằng học tăng cường (RL) quy mô lớn.

## KIẾN THỨC NỀN

Các mô hình Mixture-of-Experts (MoE) định tuyến dữ liệu đầu vào đến các mạng con chuyên biệt, cho phép đạt tổng số tham số cao nhưng vẫn giữ chi phí tính toán trên mỗi truy vấn ở mức thấp. Trong khi đó, KV Cache lưu trữ các token chú ý (attention) trước đó trong quá trình sinh văn bản để tránh tính toán lặp lại, nhưng nó tiêu tốn lượng lớn bộ nhớ GPU băng thông cao (HBM), tạo ra điểm nghẽn đáng kể cho các ứng dụng có ngữ cảnh dài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#DeepSeek#LLM#MoE Architecture#Inference Optimization#AI Infrastructure

$ subscribe --daily

DeepSeek V4.1 Flash Ra Mắt Trên Nền Tảng Siêu Máy Tính Quốc Gia Trung Quốc | Daily News