DeepSeek Ra Mắt Mô Hình Đa Phương Thức Thử Nghiệm DeepSeek-V4-Flash-Vision-Exp
DeepSeek đã ra mắt `deepseek-v4-flash-vision-exp`, một mô hình thị giác-ngôn ngữ thử nghiệm, trên nền tảng API của mình. Mô hình này hỗ trợ đầu vào cả văn bản và hình ảnh thuộc các định dạng như JPEG, PNG, GIF và WebP cho các tác vụ như mô tả ảnh, nhận dạng văn bản và phân tích biểu đồ. Bản phát hành này mang lại khả năng đa phương thức cho kiến trúc V4 thế hệ tiếp theo của DeepSeek, giúp tăng đáng kể hiệu suất trên các bài kiểm tra đánh giá tác nhân (agent) lên gần mức Opus-4.8. Nó cho phép các nhà phát triển xây dựng các tác nhân AI thị giác mạnh mẽ hơn mà không làm mất đi tốc độ và chi phí thấp của mô hình Flash. Mô hình tính phí hình ảnh dựa trên token (tối đa 384 token mỗi ảnh) với mức giá tương đương bản V4-Flash thuần văn bản. Ngoài ra, DeepSeek cũng giới thiệu Files API miễn phí, cho phép người dùng tải ảnh lên một lần và tham chiếu qua `file_id` để tiết kiệm băng thông yêu cầu.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn đa phương thức (LLM) tích hợp xử lý thị giác với tạo văn bản, cho phép chúng hiểu ảnh chụp màn hình, tài liệu và các cảnh thực tế. Các bài kiểm tra đánh giá tác nhân (agent benchmark) đo lường khả năng thực hiện các quy trình công việc phức tạp, nhiều bước và sử dụng các công cụ bên ngoài để giải quyết vấn đề của mô hình.