WeChat mở mã nguồn họ mô hình nhúng đa thức thể WeMM-Embedding xử lý 1 tỷ lượt gọi mỗi ngày
WeChat AI đã chính thức mở mã nguồn WeMM-Embedding, một họ mô hình nhúng đa thức thể (multimodal embedding) dùng chung với các phiên bản 2B, 4B và 9B tham số. Mô hình có khả năng xử lý văn bản, hình ảnh, video, tài liệu thị giác và dữ liệu đan xen, đồng thời vươn lên vị trí số 1 trên bảng xếp hạng MMEB-v2. WeMM-Embedding đã được kiểm chứng ở quy mô công nghiệp khổng lồ trong WeChat, xử lý hơn 1 tỷ lượt gọi API mỗi ngày cho các tính năng tìm kiếm Moments, gợi ý Kênh video, Tài khoản chính thức và thương mại điện tử. Việc mở mã nguồn một mô hình nhúng dẫn đầu bảng xếp hạng và đã trải qua thực tế sản xuất cấp doanh nghiệp mang lại cho cộng đồng nhà phát triển một nền tảng vững chắc cho các hệ thống tìm kiếm và truy xuất đa thức thể. Được xây dựng trên nền tảng họ mô hình Qwen, WeMM-Embedding tích hợp kỹ thuật Học biểu diễn Matryoshka (MRL), cho phép một mô hình duy nhất tạo ra các vectơ nhúng lồng nhau với số chiều linh hoạt để tối ưu hóa lưu trữ và truy vấn. Mô hình hiện đã có mặt trên Hugging Face và GitHub, hỗ trợ tích hợp trực tiếp thông qua thư viện SentenceTransformers.
## KIẾN THỨC NỀN
Các mô hình nhúng đa thức thể (multimodal embedding) ánh xạ nhiều loại dữ liệu khác nhau—như văn bản, hình ảnh và video—vào một không gian vectơ chung để các thuật toán thực hiện tìm kiếm tương đồng ngữ nghĩa giữa các định dạng. MMEB-v2 (Massive Multimodal Embedding Benchmark) là một bảng kiểm chuẩn quan trọng dùng để đánh giá mô hình nhúng qua nhiều tác vụ như truy xuất, phân loại, định vị khoảnh khắc và giải đáp câu hỏi.