~/MULTIMODAL A/giving-deepseek-v4-flash-vision-via-a-40m-parameter-connector

Thêm khả năng thị giác cho DeepSeek V4 Flash bằng bộ kết nối 40M

Một nhà phát triển mã nguồn mở đã bổ sung thành công khả năng thị giác cơ bản cho mô hình thuần văn bản DeepSeek V4 Flash bằng cách huấn luyện một bộ kết nối MLP 40,1 triệu tham số trên 100.000 ví dụ hình ảnh-văn bản. Cả mô hình ngôn ngữ lớn và bộ mã hóa hình ảnh MoonViT 417 triệu tham số đều được giữ đóng băng (frozen) trong suốt quá trình huấn luyện. Dự án này chứng minh một phương pháp hiệu quả về chi phí (khoảng 2.000 USD) để chuyển đổi một mô hình Mixture-of-Experts (MoE) thuần văn bản khổng lồ thành mô hình đa phương thức mà không cần huấn luyện lại toàn bộ tham số tốn kém. Nó cung cấp cho cộng đồng mã nguồn mở một bản thiết kế thực tế và các trọng số để xây dựng các bộ kết nối thị giác-ngôn ngữ gọn nhẹ. Mô hình được lượng tử hóa sang định dạng NVFP4 và chạy thử nghiệm bằng khung phát triển SGLang trên bốn GPU NVIDIA B200. Mặc dù mô hình thử nghiệm thực hiện thành công các tác vụ OCR cơ bản và định vị giao diện người dùng (UI grounding), nó vẫn chưa đạt chất lượng thương mại và có thể gặp hiện tượng ảo giác chi tiết hoặc bỏ sót văn bản nhỏ do quy mô huấn luyện còn hạn chế.

## KIẾN THỨC NỀN

Các mô hình đa phương thức thường căn chỉnh các đặc trưng hình ảnh với các vector nhúng văn bản bằng cách sử dụng một bộ kết nối (như lớp chiếu hoặc MLP) để làm cầu nối giữa bộ mã hóa hình ảnh và mô hình ngôn ngữ. SGLang là một khung phục vụ mã nguồn mở hiệu năng cao được thiết kế cho suy luận LLM và đa phương thức với độ trễ thấp và thông lượng cao, trong khi NVFP4 là định dạng dấu phẩy động 4-bit được tối ưu hóa để suy luận hiệu quả trên phần cứng NVIDIA hiện đại.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#DeepSeek#Representation Alignment#Open Source AI#LLM Training

$ subscribe --daily

Thêm khả năng thị giác cho DeepSeek V4 Flash bằng bộ kết nối 40M | Daily News