Qualcomm Chạy Mô Hình AI MoE 30 Tỷ Tham Số Trực Tiếp Trên Chip Snapdragon 8 Gen 6
Qualcomm đã hợp tác với StepFun và các công ty công nghệ khác để tối ưu hóa và chạy trực tiếp mô hình StepEdge-Omni 30B-MoE 30 tỷ tham số trên nền tảng di động Snapdragon 8 Gen 6. Hệ thống đạt tốc độ prefill vượt quá 330 token/giây và tốc độ decode hơn 28 token/giây. Việc chạy trực tiếp mô hình lớn 30 tỷ tham số trên phần cứng di động đánh dấu bước tiến lớn cho AI tại biên (edge AI), cho phép triển khai các tính năng tác nhân thông minh với độ trễ thấp và bảo mật cao. Nhờ cắt giảm hơn 50% nhu cầu bộ nhớ, các khả năng AI tạo sinh phức tạp có thể hoạt động tại chỗ trên điện thoại thông minh mà không cần phụ thuộc vào hạ tầng đám mây. Mức tăng hiệu năng này đạt được nhờ sự kết hợp tối ưu hóa trên động cơ suy luận, điều phối tác vụ dị thể và quản lý lưu trữ. Mô hình trên thiết bị có thể xử lý hiệu quả các tác vụ tại chỗ như phân tích email, lập kế hoạch chuyến đi, đồng bộ lịch và tạo đề xuất.
## KIẾN THỨC NỀN
Quá trình suy luận mô hình ngôn ngữ lớn gồm hai giai đoạn: prefill (tiếp nhận và xử lý toàn bộ ngữ cảnh đầu vào) và decode (tạo văn bản đầu ra theo từng token nối tiếp). Kiến trúc Hỗn hợp Chuyên gia (MoE - Mixture of Experts) là một thiết kế mô hình chỉ kích hoạt các mạng con chuyên biệt (chuyên gia) thay vì toàn bộ tham số, giúp giảm đáng kể nhu cầu tính toán và băng thông bộ nhớ.