Hiệu năng tốc độ cao của mô hình LFM 2.6B từ Liquid AI trên GPU tiêu dùng
Một người dùng báo cáo đạt tốc độ tạo văn bản 260 token/giây và xử lý prompt lên tới 20.000 token/giây khi chạy mô hình LFM 2.6B của Liquid AI trên GPU RTX 3090. Mô hình này tỏ ra rất hiệu quả cho các tác vụ nhanh, độ phức tạp thấp như tóm tắt văn bản và tự động hoàn thành câu lệnh. Điều này chứng minh khả năng ứng dụng thực tế của các kiến trúc phi Transformer như Liquid Foundation Models cho việc triển khai cục bộ tốc độ cao trên phần cứng tiêu dùng. Nó mang lại cho các nhà phát triển một giải pháp thay thế hiệu quả cho các ứng dụng AI biên yêu cầu độ trễ thấp và cửa sổ ngữ cảnh lớn. Mô hình LFM 2.6B hỗ trợ cửa sổ ngữ cảnh lên tới 128k token, giúp nó phù hợp để xử lý các tài liệu lớn bất chấp kích thước tham số nhỏ. Tuy nhiên, người dùng lưu ý rằng mô hình này phù hợp nhất cho các tác vụ đơn giản thay vì các lập luận phức tạp.
## KIẾN THỨC NỀN
Liquid Foundation Models (LFM) được phát triển bởi Liquid AI, một công ty khởi nghiệp tập trung vào các mô hình nền tảng tối ưu hóa hiệu năng. Khác với các mô hình dựa trên Transformer truyền thống, LFM sử dụng các kiến trúc thay thế như mạng nơ-ron lỏng (liquid neural networks) và mô hình không gian trạng thái (state-space models), giúp tự động điều chỉnh đường dẫn tính toán để đạt được lượng bộ nhớ nhỏ hơn và suy luận nhanh hơn.