~/LOCAL LLMS/lemonade-local-ai-serving-stack-updates-with-15-engines-and-semantic-routing

Bản cập nhật Lemonade hỗ trợ 15 engine và định tuyến ngữ nghĩa cho AI cục bộ

Bộ công cụ chạy AI cục bộ mã nguồn mở Lemonade đã phát hành bản cập nhật cuối hè, mở rộng hỗ trợ lên 15 engine và giới thiệu các backend đa nền tảng cho CUDA, ARM64, Metal và Vulkan. Bản cập nhật này cũng bổ sung tính năng định tuyến chính sách và ngữ nghĩa nâng cao để tự động chọn LLM tối ưu dựa trên câu lệnh của người dùng. Bản cập nhật này đơn giản hóa việc phát triển ứng dụng AI cục bộ bằng cách cung cấp một dịch vụ hợp nhất, chìa khóa trao tay giúp quản lý nhiều mô hình và phương thức khác nhau (như âm nhạc và tài sản 3D) dưới một API duy nhất. Bằng cách tích hợp tăng tốc phần cứng đa nền tảng và định tuyến thông minh, nó giúp các nhà phát triển xây dựng các tác nhân AI cục bộ đa mô hình hiệu quả hơn. Bản phát hành bao gồm hỗ trợ thử nghiệm cho các engine tối ưu hóa như DwarfStar4 (công cụ suy luận C của antirez dành cho DeepSeek V4) và tích hợp SDK nhúng để đóng gói vào ứng dụng. Lộ trình phát triển tương lai bao gồm việc thay thế hoàn toàn giao diện GUI, các công cụ đo hiệu năng (benchmarking) và giao diện plugin.

## KIẾN THỨC NỀN

Các bộ công cụ chạy AI cục bộ (local AI serving stacks) cho phép nhà phát triển chạy các mô hình ngôn ngữ lớn trực tiếp trên phần cứng cá nhân mà không cần phụ thuộc vào API đám mây, giúp đảm bảo quyền riêng tư và giảm độ trễ. Định tuyến ngữ nghĩa (semantic routing) là kỹ thuật phân tích ý nghĩa của câu lệnh đầu vào để điều hướng nó một cách linh hoạt đến mô hình chuyên biệt hoặc cơ sở dữ liệu phù hợp nhất.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#AI Infrastructure#Model Serving#Open Source

$ subscribe --daily

Bản cập nhật Lemonade hỗ trợ 15 engine và định tuyến ngữ nghĩa cho AI cục bộ | Daily News