~/ARTIFICIAL I/deepseek-releases-v4-1-flash-model-with-native-multimodal-support-and-architecture

DeepSeek chính thức ra mắt mô hình V4.1 Flash với khả năng đa thức nguyên bản và kiến trúc mới

DeepSeek đã chính thức ra mắt DeepSeek V4.1 Flash, một mô hình Mixture-of-Experts (MoE) 552 tỷ tham số tích hợp khả năng hiểu thị giác đa thức nguyên bản. Mô hình này vượt trội hơn bản flagship tiền nhiệm V4 Pro về hiệu năng, tốc độ lẫn chi phí, đồng thời hạ giá thành API với chính sách ưu đãi giờ thấp điểm. Đợt phát hành này thiết lập một tiêu chuẩn mới cho việc vận hành các mô hình đa thức quy mô lớn bằng cách giảm mạnh nhu cầu bộ nhớ và chi phí vận hành. Nhờ nén đáng kể chi phí KV cache, việc xử lý ngữ cảnh dài và các tác vụ AI agent phức tạp trở nên tiết kiệm hơn nhiều cho các nhà phát triển và ứng dụng doanh nghiệp. Được xây dựng trên kiến trúc Causal-Encoder-Decoder bất đối xứng mới, V4.1 Flash chỉ kích hoạt 8 tỷ tham số ở đầu vào và 16 tỷ tham số ở đầu ra trong tổng số 552 tỷ tham số. So với thế hệ trước, dung lượng KV cache của mô hình giảm 75% nhu cầu bộ nhớ băng thông cao (HBM) và 87.5% bộ nhớ SSD, đạt mức giảm tích lũy 437 lần so với mô hình thế hệ đầu của DeepSeek.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn phụ thuộc vào KV cache để lưu trữ các trạng thái chú ý giúp sinh token nhanh chóng, nhưng điều này tiêu tốn lượng lớn bộ nhớ băng thông cao (HBM) trong quá trình suy luận ngữ cảnh dài. Ngoài ra, kiến trúc Mixture-of-Experts (MoE) cho phép mở rộng tổng số tham số của mô hình trong khi chỉ kích hoạt một tập hợp con tham số cho mỗi yêu cầu để duy trì tốc độ suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Artificial Intelligence#Large Language Models#DeepSeek#Multimodal AI#Machine Learning Architecture

$ subscribe --daily