~/DEEPSEEK/deepseek-adds-vision-capabilities-to-v4-flash-experimental-model

DeepSeek Bổ Sung Khả Năng Thị Giác Cho Mô Hình Thử Nghiệm v4-flash

DeepSeek đã giới thiệu khả năng thị giác cho mô hình thử nghiệm v4-flash, cho phép người dùng nhập hình ảnh trực tiếp qua API. Mô hình sẽ tự động thay đổi kích thước hình ảnh và tính phí dưới dạng token cùng với văn bản đầu vào. Bản cập nhật này cung cấp cho các nhà phát triển một lựa chọn đa phương thức tiết kiệm chi phí hơn cho các tác vụ yêu cầu cả xử lý văn bản và hình ảnh, giảm thiểu việc phải chuyển sang các mô hình khác cho các tác vụ hình ảnh cơ bản. Trước khi suy luận, hình ảnh sẽ tự động được thay đổi kích thước: các ảnh dưới 384x384 pixel sẽ được phóng to, trong khi các ảnh lớn hơn sẽ bị thu nhỏ xuống khoảng 800x800 pixel để giữ nguyên tỷ lệ khung hình trước khi được chuyển đổi thành token.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn đa phương thức (MLLM) xử lý hình ảnh bằng cách chuyển đổi chúng thành các token thị giác, ánh xạ các pixel thành các vectơ cao chiều trong không gian nhúng. Điều này cho phép mô hình ngôn ngữ cốt lõi xử lý dữ liệu hình ảnh dưới cùng một định dạng như các token văn bản.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#DeepSeek#Multimodal AI#Computer Vision#LLM API

$ subscribe --daily

DeepSeek Bổ Sung Khả Năng Thị Giác Cho Mô Hình Thử Nghiệm v4-flash | Daily News