Kết Nối iPhone Với MacBook Pro Giúp Tăng Tốc Độ Prefill LLM Đến 44%
Nhà phát triển "u/StayLameBro" đã tạo ra một công cụ mã nguồn mở có tên "backburner", cho phép chuyển bớt các lớp transformer của mô hình Qwen3.8-27B từ MacBook Pro (M4 Pro) sang chiếc iPhone 17 Pro Max kết nối qua USB-C. Nhờ áp dụng mô hình song song đường ống (pipeline parallelism) trên cả hai thiết bị, tốc độ prefill câu lệnh đã tăng tới 44% ở độ dài ngữ cảnh 16K so với khi chỉ dùng máy Mac. Thử nghiệm này thể hiện một phương pháp AI tại biên (edge AI) độc đáo giúp vượt qua giới hạn bộ nhớ và hiệu năng của laptop bằng cách hợp lực tài nguyên phần cứng với thiết bị di động. Nó cho thấy các kết nối có dây tốc độ cao như USB-C có thể cho phép suy luận LLM phân tán đa thiết bị ngay trong môi trường cá nhân. Trong quy trình này, MacBook Pro xử lý các lớp từ 1 đến 40 cho mỗi lô 256 token và truyền dữ liệu kích hoạt (activation data) sang iPhone để chạy các lớp từ 41 đến 64 bằng GPU A19 Pro và Neural Engine. Một hạn chế quan trọng là cấu hình này chỉ giúp tăng tốc giai đoạn prefill câu lệnh tiêu tốn tính toán, còn giai đoạn sinh văn bản (decode) vẫn hoàn toàn do máy Mac đảm nhiệm.
## KIẾN THỨC NỀN
Quá trình suy luận của LLM diễn ra theo hai giai đoạn chính: prefill (xử lý song song toàn bộ câu lệnh đầu vào để tính toán trạng thái ban đầu) và decode (sinh từng token đầu ra theo thứ tự tuần tự). Kỹ thuật đẩy lớp (layer offloading) phân chia các lớp của mô hình transformer sang nhiều bộ xử lý hoặc thiết bị phần cứng khác nhau nhằm giảm áp lực bộ nhớ và tăng năng suất xử lý.