~/AI ML/google-deepmind-releases-embeddinggemma-2-open-multimodal-embedding-model

Google DeepMind Ra Mắt EmbeddingGemma 2 - Mô Hình Nhúng Đa Phương Thức Mở

Google DeepMind đã phát hành EmbeddingGemma 2, một mô hình nhúng đa phương thức mã nguồn mở 740 triệu tham số giúp biểu diễn văn bản, hình ảnh, video và âm thanh vào cùng một không gian vectơ 768 chiều thống nhất. Được phát triển dựa trên các cải tiến của Gemma 4, mô hình này hỗ trợ cửa sổ ngữ cảnh 8K token, hơn 100 ngôn ngữ và cải thiện khả năng xử lý mã nguồn. EmbeddingGemma 2 cho phép thực hiện các tác vụ RAG đa phương thức, tìm kiếm và phân loại hiệu năng cao ngay trên thiết bị cá nhân như máy tính xách tay và điện thoại di động. Kiến trúc mô-đun của nó cho phép các nhà phát triển tải tùy chọn các bộ mã hóa hình ảnh hoặc âm thanh, giúp giảm đáng kể mức sử dụng bộ nhớ cho từng trường hợp sử dụng cụ thể. Mô hình bao gồm khung xương văn bản 270M, bộ mã hóa thị giác 170M và bộ mã hóa âm thanh 300M, tích hợp sẵn kỹ thuật Matryoshka Representation Learning (MRL) để cắt giảm chiều vectơ xuống đến 128d, giúp giảm chi phí lưu trữ lên đến 6 lần. Ngoài ra, mô hình sử dụng các tiền tố hướng dẫn văn bản để tối ưu hóa vectơ nhúng cho từng tác vụ cụ thể như tìm kiếm hoặc đo độ tương đồng ngữ nghĩa.

## KIẾN THỨC NỀN

Vectơ nhúng đa phương thức (multimodal embeddings) giúp ánh xạ các loại dữ liệu khác nhau—như văn bản, hình ảnh và âm thanh—vào một không gian vectơ toán học chung, nơi các khái niệm có ngữ nghĩa tương đồng nằm gần nhau bất kể định dạng dữ liệu. Kỹ thuật RAG (Retrieval-Augmented Generation) truy xuất thông tin từ các cơ sở dữ liệu bên ngoài thông qua các vectơ nhúng này để cung cấp ngữ cảnh cho các mô hình ngôn ngữ lớn trước khi tạo câu trả lời.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#Multimodal#Embeddings#Google DeepMind#Local LLMs

$ subscribe --daily

Google DeepMind Ra Mắt EmbeddingGemma 2 - Mô Hình Nhúng Đa Phương Thức Mở | Daily News