~/LLM INFERENC/developer-runs-lfm-2-5-2-6b-model-on-mobile-cpu-at

Nhà phát triển chạy mô hình LFM-2.5 2.6B trên CPU di động đạt 17 token/giây

Một nhà phát triển đã chạy thành công mô hình LFM-2.5 với 2,6 tỷ tham số đạt tốc độ 17 token/giây trên CPU của điện thoại OnePlus 13. Thành tựu này đạt được nhờ sử dụng một công cụ suy luận (inference engine) tự viết siêu nhẹ với dung lượng chỉ 450kb. Bản thử nghiệm này cho thấy tính khả thi của việc chạy các mô hình ngôn ngữ lớn cục bộ trên phần cứng di động phổ thông mà không cần phụ thuộc vào máy chủ đám mây hay GPU di động. Nó làm nổi bật tiềm năng của các công cụ suy luận siêu nhỏ, được tối ưu hóa cao trong việc kích hoạt AI biên và các quy trình làm việc của tác nhân (agent) trên các thiết bị hàng ngày. Mô hình được sử dụng là phiên bản lượng hóa Q4_K_M GGUF của LFM-2.5 với 2,69 tỷ tham số và cửa sổ ngữ cảnh 128K. Công cụ tự phát triển 450kb này cũng hỗ trợ các kiến trúc mô hình khác như Qwen, Gemma và Bonsai, và nhà phát triển đang đặt mục tiêu nâng hiệu suất lên 30 token/giây.

## KIẾN THỨC NỀN

Liquid Foundation Models (LFMs) là một nhóm các mô hình AI tạo sinh do Liquid AI phát triển, được thiết kế để đạt hiệu suất tính toán cao, độ trễ thấp và triển khai trực tiếp trên thiết bị. GGUF là định dạng tệp dùng để lưu trữ các mô hình phục vụ suy luận, thường sử dụng các phương pháp lượng hóa như Q4_K_M để nén trọng số mô hình (giảm hơn 70% dung lượng bộ nhớ) trong khi vẫn giữ lại hầu hết độ chính xác.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#Mobile AI#Edge Computing#Local LLMs

$ subscribe --daily

Nhà phát triển chạy mô hình LFM-2.5 2.6B trên CPU di động đạt 17 token/giây | Daily News