~/MULTIMODAL A/tencent-releases-wemm-embedding-a-multimodal-embedding-model-family

Tencent Ra Mắt WeMM-Embedding, Dòng Mô Hình Nhúng Đa Phương Thức

Tencent đã phát hành WeMM-Embedding, một dòng mô hình nhúng đa phương thức mã nguồn mở với các phiên bản 9B, 4B và 2B tham số được xây dựng trên nền tảng Qwen3.5. Các mô hình này có thể xử lý văn bản, hình ảnh, video, tài liệu trực quan và các đầu vào đa phương thức xen kẽ để tạo ra các vector nhúng thống nhất. Việc phát hành này cung cấp cho cộng đồng mã nguồn mở các công cụ mạnh mẽ cho các hệ thống Tạo truy xuất tăng cường (RAG) nâng cao cần tìm kiếm đồng thời trên nhiều loại phương tiện truyền thông khác nhau. Bằng cách hỗ trợ các đầu vào xen kẽ, nó cho phép thực hiện các truy vấn tìm kiếm phức tạp hơn kết hợp liền mạch giữa văn bản và các yếu tố trực quan. Mô hình WeMM-Embedding-9B xuất ra vector nhúng chuẩn hóa L2 với kích thước 4.096 chiều, giúp đơn giản hóa việc tính toán độ tương đồng thành tích vô hướng trong các cơ sở dữ liệu vector. Tuy nhiên, dòng mô hình này hiện chưa hỗ trợ đầu vào âm thanh.

## KIẾN THỨC NỀN

Các mô hình nhúng (embedding) chuyển đổi dữ liệu phi cấu trúc như văn bản hoặc hình ảnh thành các vector số dày đặc nhằm nắm bắt ý nghĩa ngữ nghĩa. Nhúng đa phương thức chiếu các loại dữ liệu khác nhau vào một không gian vector chung, cho phép một truy vấn văn bản có thể truy xuất các hình ảnh hoặc video liên quan. Chuẩn hóa L2 tỷ lệ các vector này về độ dài đơn vị bằng một, nghĩa là phép tính tích vô hướng đơn giản giữa hai vector sẽ cho ra độ tương đồng cosine của chúng, giúp các hoạt động tìm kiếm đạt hiệu quả cao.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#Embedding Models#Machine Learning#Open Weights

$ subscribe --daily

Tencent Ra Mắt WeMM-Embedding, Dòng Mô Hình Nhúng Đa Phương Thức | Daily News