Google DeepMind Ra Mắt EmbeddingGemma 2: Mô Hình Nhúng Đa Phương Thức Mở
Google DeepMind đã phát hành EmbeddingGemma 2, một mô hình mã nguồn mở 740 triệu tham số giúp ánh xạ văn bản, mã nguồn, hình ảnh, video và âm thanh vào một không gian vector 768 chiều duy nhất. Được thiết kế tối ưu độ trễ thấp trên phần cứng cá nhân như thiết bị di động và máy tính xách tay, mô hình hỗ trợ các tác vụ tìm kiếm, RAG và phân loại ngay trên thiết bị. Cung cấp một mô hình nhúng mở có hiệu suất cao cho phép các nhà phát triển xây dựng ứng dụng tìm kiếm và truy xuất bảo mật, độ trễ thấp trực tiếp trên thiết bị của người dùng mà không cần phụ thuộc vào dịch vụ đám mây bên ngoài. Động thái này thúc đẩy hệ sinh thái AI mã nguồn mở bằng cách thống nhất biểu diễn ngữ nghĩa giữa văn bản, hình ảnh và âm thanh. Kiến trúc 740 triệu tham số của mô hình kết hợp các bộ mã hóa mô-đun bao gồm mô hình văn bản 270M, bộ mã hóa thị giác 170M và bộ mã hóa âm thanh 300M. Các đầu vào thuộc nhiều định dạng dữ liệu khác nhau được chiếu vào một không gian vector nhúng 768 chiều duy nhất, phục vụ tốt cho các tác vụ phân cụm và truy xuất trên thiết bị.
## KIẾN THỨC NỀN
Nhúng đa phương thức (multimodal embeddings) biểu diễn các loại dữ liệu khác nhau—như văn bản, hình ảnh và âm thanh—trong một không gian vector chung sao cho nội dung có ngữ nghĩa tương đồng sẽ nằm gần nhau bất kể định dạng. Kỹ thuật RAG (Retrieval-Augmented Generation) sử dụng các vector nhúng này để tìm kiếm thông tin liên quan từ cơ sở dữ liệu nhằm bổ sung ngữ nghĩa chính xác cho mô hình ngôn ngữ lớn.