DeepSeek phát hành DeepSeek-V4-Flash-Vision-Exp trên Hugging Face
DeepSeek đã phát hành DeepSeek-V4-Flash-Vision-Exp, một mô hình đa phương thức thử nghiệm, trên Hugging Face. Mô hình này chấp nhận cả hình ảnh và văn bản, cho phép thực hiện các tác vụ như đọc văn bản từ ảnh chụp màn hình, mô tả hình ảnh và phân tích biểu đồ. Bản phát hành này đánh dấu sự khởi đầu của dòng mô hình V4 của DeepSeek, tập trung vào tốc độ và khả năng đa phương thức. Nó cải thiện đáng kể khả năng của tác nhân đa phương thức so với phiên bản tiền nhiệm DeepSeek-V4-Flash-0731, trong khi vẫn duy trì hiệu suất xử lý văn bản mạnh mẽ. Mô hình hỗ trợ các định dạng hình ảnh phổ biến bao gồm JPEG, PNG, GIF và WebP. Nó được thiết kế để hoạt động như một tác nhân cấp quy trình công việc (workflow-level agent) có thể tiếp nhận ngữ cảnh trực quan thay vì chỉ là một công cụ chú thích hình ảnh đơn giản.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ thị giác (VLM) là các hệ thống trí tuệ nhân tạo có khả năng xử lý và tạo thông tin từ cả đầu vào hình ảnh và văn bản. Các mô hình này mở rộng khả năng của các mô hình ngôn ngữ lớn (LLM) chỉ hỗ trợ văn bản để cho phép các ứng dụng như trả lời câu hỏi trực quan và phân tích tài liệu.