~/LLM INFERENC/high-speed-local-llm-inference-on-ipados-via-external-amd-gpu-port

Suy luận LLM cục bộ tốc độ cao trên iPadOS qua GPU AMD gắn ngoài

LemonSeed Studio đã trình diễn khả năng chạy mô hình ngôn ngữ Qwen3.8-27B đạt tốc độ 158,5 token/giây trên iPad kết nối với GPU ngoài AMD Radeon AI PRO R9700 qua cổng Thunderbolt. Thành tựu này đạt được bằng cách chuyển cổng (port) trình điều khiển Linux kernel (amdgpu và amdkfd) sang iPadOS dưới dạng phần mở rộng PCIDriverKit kết hợp với công cụ đồ thị LemonSeed. Thành tựu kỹ thuật này phá vỡ các giới hạn nền tảng truyền thống khi kích hoạt khả năng tăng tốc phần cứng từ GPU rời cấp máy tính để bàn trên iPadOS cho các tác vụ AI nặng. Nó cho thấy việc kết hợp các phần mở rộng trình điều khiển tùy chỉnh với kỹ thuật giải mã suy đoán như DFlash2 có thể mang lại tốc độ suy luận LLM tương đương máy tính để bàn ngay trên hệ điều hành di động. LemonSeed Engine (LSE 0.5.8) ghi lại lượt lan truyền tiến của mô hình dưới dạng đồ thị tính toán, hợp nhất các phép toán và đo kiểm bố cục kernel trực tiếp trên thiết bị để chọn đường dẫn thực thi nhanh nhất. Việc bật giải mã suy đoán với cây bản nháp DFlash2 đã giúp tăng hiệu năng suy luận trên iPadOS từ mức cơ bản 31,2 tok/s lên 158,5 tok/s, ngang ngửa macOS và duy trì tốc độ prefill trên 1.600 tok/s ở ngữ cảnh 4K.

## KIẾN THỨC NỀN

Khung làm việc PCIDriverKit của Apple cho phép nhà phát triển tạo các trình điều khiển ở không gian người dùng (user-space) để điều khiển phần cứng PCI Express kết nối qua Thunderbolt. Giải mã suy đoán (speculative decoding) giúp tăng tốc sinh dữ liệu LLM bằng cách sử dụng một mô hình bản nháp nhỏ hơn—chẳng hạn như mô hình khuếch tán khối DFlash2—để nhanh chóng tạo ra các token ứng viên mà mô hình mục tiêu lớn hơn sẽ xác thực song song trong một lượt duy nhất.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#Edge Computing#Hardware Acceleration#Speculative Decoding#Local AI

$ subscribe --daily

Suy luận LLM cục bộ tốc độ cao trên iPadOS qua GPU AMD gắn ngoài | Daily News