LFM 2.5 230M Chạy Đạt 1440 Token/Giây Trên Trình Duyệt Qua Backend WebGPU Tùy Biến
Một nhà phát triển đã trình diễn backend WebGPU tùy biến chạy mô hình LFM 2.5 230M trực tiếp trên trình duyệt với tốc độ lên tới 1440 token/giây trên card đồ họa RTX 3090. Dự án này đạt hiệu năng cao nhờ tối ưu hóa các kernel đặc thù cho phần cứng của kiến trúc Nvidia và Apple Silicon. Bản trình diễn này nêu bật tính khả thi của việc chạy các mô hình AI hiệu năng cao, độ trễ thấp trực tiếp trên thiết bị của người dùng mà không cần phụ thuộc vào máy chủ đám mây. Điều này mở đường cho các ứng dụng AI biên (edge AI) nhanh hơn, bảo mật hơn, chạy trực tiếp trên trình duyệt web hoặc các framework máy tính như Electron và Tauri. Backend này sử dụng các kernel đa luồng được hợp nhất mạnh mẽ (multi-pass fused kernels) cho GPU Nvidia, đồng thời áp dụng một mega-kernel hợp nhất cho Apple Silicon để giảm thiểu hao phí từ kỹ thuật TBDR (Tile-Based Deferred Rendering). Nhà phát triển có kế hoạch tích hợp các tối ưu hóa này vào thư viện mã nguồn mở Sipp, một runtime WebGPU được xây dựng bằng Rust và C++.
## KIẾN THỨC NỀN
WebGPU là một tiêu chuẩn web hiện đại cho phép các ứng dụng web truy cập vào GPU của thiết bị để tăng tốc đồ họa và tính toán. Liquid Foundation Models (LFM) là một nhóm kiến trúc AI gọn nhẹ, tiết kiệm tài nguyên tính toán, được thiết kế để suy luận nhanh và triển khai trực tiếp trên thiết bị. GPU của Apple Silicon sử dụng kỹ thuật TBDR (Tile-Based Deferred Rendering), một phương pháp xử lý đồ họa theo từng vùng lưới nhỏ (tile) để tối ưu hóa hiệu suất năng lượng, đòi hỏi thiết kế kernel đặc thù để tránh nghẽn cổ chai hiệu năng.