~/LLAMA CPP/llama-cpp-b11240-adds-multimodal-embeddings-support-to-server-api

llama.cpp b11240 Hỗ Trợ Embeddings Đa Phương Tiện Trong Server API

Bản phát hành llama.cpp b11240 bổ sung khả năng hỗ trợ đầu vào nội dung có kiểu dữ liệu theo chuẩn OpenAI—bao gồm hình ảnh, âm thanh và video—cho điểm cuối /v1/embeddings trên máy chủ. Cập nhật này cho phép tạo vector biểu diễn (embedding) cho các mô hình đa phương tiện như Qwen3-VL-Embedding trực tiếp qua giao diện máy chủ cục bộ. Cải tiến này mở rộng khả năng của các máy chủ suy luận cục bộ nguồn mở, cho phép các nhà phát triển xây dựng các ứng dụng tìm kiếm và RAG (truy xuất thông tin tăng cường) đa phương thức. Việc tuân theo định dạng mảng nội dung chuẩn của OpenAI giúp đảm bảo tính tương thích mượt mà với các quy trình ứng dụng AI đa phương tiện hiện đại. Điểm cuối API mới chấp nhận các mảng nội dung dạng bao gói OpenAI, trong đó phần văn bản được nối lại và dữ liệu truyền thông được giải mã để ghép vào prompt, đồng thời vẫn duy trì tương thích ngược với các định dạng chuỗi và token cũ. Ngoài ra, tính năng tái sử dụng tiền tố KV (Key-Value) bị tắt cho các tác vụ embedding và rerank không trạng thái để tránh chia sẻ sai bộ nhớ đệm KV giữa các yêu cầu.

## KIẾN THỨC NỀN

llama.cpp là một khung làm việc nguồn mở phổ biến được thiết kế để suy luận các mô hình ngôn ngữ lớn (LLM) với hiệu suất cao trên nhiều nền tảng phần cứng CPU và GPU. Embeddings giúp chuyển đổi các dữ liệu không cấu trúc như văn bản, hình ảnh hoặc âm thanh thành các vector toán học, hỗ trợ tìm kiếm ngữ nghĩa và truy xuất trong các quy trình AI.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#open-source#multimodal-ai#llm-inference#embeddings

$ subscribe --daily

llama.cpp b11240 Hỗ Trợ Embeddings Đa Phương Tiện Trong Server API | Daily News