~/AI ML/simon-willison-highlights-why-open-models-like-embeddinggemma-2-prevent-vendor-lock

Simon Willison nhấn mạnh lý do mô hình mở như EmbeddingGemma 2 giúp tránh phụ thuộc nhà cung cấp

Google đã phát hành EmbeddingGemma 2 theo giấy phép mã nguồn mở Apache 2.0, cung cấp một mô hình embedding đa thức năng mở. Nhà phát triển nổi tiếng Simon Willison nhấn mạnh rằng các mô hình embedding có giấy phép mở là điều thiết yếu để bảo vệ nhà phát triển khỏi chi phí tính toán lại vector đắt đỏ nếu nhà cung cấp ngừng hỗ trợ các mô hình độc quyền. Các ứng dụng sử dụng embedding thường lưu trữ hàng triệu vector để tìm kiếm ngữ nghĩa; nếu một nhà cung cấp ngừng hỗ trợ mô hình độc quyền, việc tính toán lại vector cho toàn bộ dữ liệu lưu trữ sẽ tiêu tốn chi phí và tài nguyên đáng kể. Các mô hình mở có trọng số công khai kèm giấy phép linh hoạt như Apache 2.0 giúp nhà phát triển yên tâm sử dụng API đám mây vì họ có thể tự host hoặc chuyển đổi mô hình đó sang nền tảng khác nếu nhà cung cấp dừng dịch vụ. EmbeddingGemma 2 tự động ánh xạ văn bản, hình ảnh, âm thanh và video vào một không gian vector thống nhất, hỗ trợ các ứng dụng tìm kiếm đa thức năng. Ngoài ra, mô hình ứng dụng phương pháp Matryoshka Representation Learning (MRL), cho phép cắt giảm kích thước vector từ 768 chiều xuống 512, 256 hoặc 128 chiều để giảm dung lượng lưu trữ.

## KIẾN THỨC NỀN

Mô hình embedding chuyển đổi dữ liệu đầu vào phi cấu trúc thành các vector số nguyên đặc sao cho các mục có cùng ngữ nghĩa nằm gần nhau trong không gian vector. Vì mỗi mô hình có cấu trúc không gian vector riêng, việc thay đổi hoặc nâng cấp mô hình embedding sẽ làm mất tính tương thích với các vector đã tạo trước đó, buộc người dùng phải đánh chỉ mục lại toàn bộ tài liệu.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#Embeddings#Open Source#Vector Search#LLM Infrastructure

$ subscribe --daily

Simon Willison nhấn mạnh lý do mô hình mở như EmbeddingGemma 2 giúp tránh phụ thuộc nhà cung cấp | Daily News