~/AI ML/deepseek-releases-experimental-deepseek-v4-flash-vision-model-checkpoint

DeepSeek Ra Mắt Checkpoint Mô Hình Thử Nghiệm DeepSeek-V4-Flash-Vision

DeepSeek đã phát hành checkpoint cho mô hình ngôn ngữ - thị giác thử nghiệm mang tên DeepSeek-V4-Flash-Vision-Exp trên Hugging Face và hỗ trợ truy cập qua API. Mô hình bổ sung khả năng hiểu hình ảnh — như phân tích biểu đồ, đọc văn bản từ ảnh chụp màn hình và mô tả ảnh — vào kiến trúc DeepSeek-V4-Flash. Bản phát hành này mở rộng hệ sinh thái trọng số mở của DeepSeek sang các khả năng đa thức (multimodal), cho phép các nhà phát triển xây dựng agent AI kết hợp khả năng suy luận văn bản mạnh mẽ với xử lý đầu vào hình ảnh. Điều này mang lại cho các nhà nghiên cứu và phát triển mã nguồn mở cơ hội tiếp cận một mô hình suy luận thị giác hiệu suất cao. Về mặt kỹ thuật, mô hình kết hợp bộ mã hóa thị giác MoonViT từ Kimi-K2.6 vào kiến trúc suy luận của DeepSeek thông qua bộ chiếu PatchMerger có nhận biết định tuyến đã qua huấn luyện. Mô hình duy trì trọn vẹn khả năng xử lý văn bản của DeepSeek-V4-Flash trong khi đạt bước tiến lớn trên các bài kiểm tra đánh giá agent đa thức.

## KIẾN THỨC NỀN

DeepSeek là một phòng nghiên cứu trí tuệ nhân tạo nổi tiếng với việc phát hành các mô hình ngôn ngữ trọng số mở hiệu suất cao. Các mô hình ngôn ngữ - thị giác (VLM) mở rộng các LLM văn bản thông thường bằng cách kết nối chúng với bộ mã hóa thị giác, cho phép mô hình xử lý dữ liệu hình ảnh cùng với các câu lệnh dạng văn bản.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#DeepSeek#Computer Vision#LLMs#Open Source AI

$ subscribe --daily

DeepSeek Ra Mắt Checkpoint Mô Hình Thử Nghiệm DeepSeek-V4-Flash-Vision | Daily News