~/DEEPSEEK/deepseek-launches-experimental-multimodal-api-model-v4-flash-vision-exp

DeepSeek Ra Mắt Mô Hình Đa Phương Thức Thử Nghiệm V4-Flash-Vision-Exp Qua API

DeepSeek đã ra mắt DeepSeek-V4-Flash-Vision-Exp, một mô hình API đa phương thức thử nghiệm hỗ trợ cả đầu vào hình ảnh và văn bản. Mô hình này cho phép người dùng thực hiện các tác vụ như mô tả hình ảnh, nhận dạng chữ viết (OCR) và phân tích biểu đồ bằng các định dạng như JPEG, PNG, GIF và WebP. Bản phát hành này cải thiện đáng kể khả năng API của DeepSeek bằng cách bổ sung hỗ trợ thị giác máy tính, cho phép các nhà phát triển xây dựng các tác nhân AI (AI Agent) đa phương thức linh hoạt hơn. Hiệu suất của mô hình trên các bài kiểm tra tác nhân dựa trên thị giác được báo cáo là gần tương đương với các mô hình cao cấp như Opus-4.8, mang lại một giải pháp thay thế tiết kiệm chi phí cho các tác vụ thị giác phức tạp. Mô hình được tính phí tương đương với bản V4-Flash, trong đó mỗi hình ảnh tiêu thụ tối đa 384 token. Ngoài ra, DeepSeek cũng giới thiệu Files API miễn phí, cho phép người dùng tải ảnh lên một lần và tham chiếu qua file_id để tiết kiệm băng thông yêu cầu.

## KIẾN THỨC NỀN

Các mô hình AI đa phương thức có thể xử lý đồng thời nhiều loại dữ liệu đầu vào khác nhau như văn bản và hình ảnh. Các tác nhân AI (AI Agent) tận dụng các mô hình này để thực hiện các tác vụ tự động, và các bài kiểm tra đánh giá tác nhân dựa trên thị giác (như VisualAgentBench) sẽ đo lường khả năng điều hướng giao diện người dùng đồ họa (GUI) hoặc giải quyết các bài toán lập luận thị giác của chúng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#DeepSeek#Multimodal AI#AI Agents#API Release

$ subscribe --daily

DeepSeek Ra Mắt Mô Hình Đa Phương Thức Thử Nghiệm V4-Flash-Vision-Exp Qua API | Daily News