~/LLM INFERENC/perplexity-open-sources-lily-inference-engine-for-apple-silicon

Perplexity mở mã nguồn công cụ suy luận 'Lily' dành cho Apple Silicon

Perplexity AI đã mở mã nguồn "Lily", một máy chủ suy luận trên Mac được thiết kế riêng để tối ưu hóa hiệu suất thực thi cho các mô hình Qwen 3.6 trên phần cứng Apple Silicon. Dự án được phát hành trên kho lưu trữ GitHub chính thức của Perplexity nhằm cung cấp khả năng suy luận trực tiếp trên thiết bị đạt hiệu năng cao. Bằng cách tập trung tối ưu hóa cho một kiến trúc mô hình và phần cứng Apple Silicon cụ thể, Lily cho phép người dùng Mac chạy suy luận cục bộ với tốc độ nhanh hơn đáng kể mà không cần dựa vào các framework tổng quát. Phát hành này thúc đẩy việc áp dụng mô hình AI kết hợp giữa cục bộ và đám mây, giúp giảm độ trễ và tăng cường tính riêng tư khi xử lý dữ liệu. Lily tích hợp các tối ưu hóa riêng biệt cho giai đoạn nạp trước prompt (prefill) và tạo token được tinh chỉnh đặc biệt cho họ mô hình Qwen 3.6 (như Qwen3.6-35B-A3B). Thay vì hoạt động như một máy chủ đa mô hình như Ollama, công cụ này tập trung tối đa vào hiệu suất của một mô hình duy nhất nhằm tận dụng tối đa bộ nhớ hợp nhất của Apple Silicon.

## KIẾN THỨC NỀN

Việc suy luận LLM cục bộ trên phần cứng cá nhân phụ thuộc lớn vào kiến trúc bộ nhớ hợp nhất (unified memory) của Apple Silicon, cho phép GPU truy cập trực tiếp vào RAM hệ thống có băng thông cao. Qwen là dòng mô hình ngôn ngữ lớn mã nguồn mở do Alibaba Cloud phát triển, rất phổ biến trong cộng đồng AI. Dù các công cụ thực thi tổng quát như Ollama hỗ trợ nhiều kiến trúc, các máy chủ suy luận chuyên biệt hóa cao có thể khai thác tối đa băng thông bộ nhớ và hiệu quả tính toán cho từng cặp mô hình và phần cứng cụ thể.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#Apple Silicon#Open Source#Local AI#Perplexity AI

$ subscribe --daily

Perplexity mở mã nguồn công cụ suy luận 'Lily' dành cho Apple Silicon | Daily News