llama.cpp b10514 Ra Mắt, Hỗ Trợ Các Mô Hình Granite SWA Của IBM
Dự án llama.cpp đã phát hành bản dựng b10514, bổ sung khả năng chuyển đổi và suy luận cho các kiến trúc mô hình GraniteSWAForCausalLM và GraniteMoeSWAForCausalLM của IBM. Bản phát hành này cho phép các nhà phát triển chạy cục bộ các mô hình Granite của IBM sử dụng cơ chế Chú ý Cửa sổ Trượt (SWA) và Hỗn hợp Chuyên gia (MoE) với hiệu suất cao. Điều này mở rộng hệ sinh thái các mô hình nguồn mở tương thích với llama.cpp, giúp các LLM tiên tiến hướng tới doanh nghiệp trở nên dễ tiếp cận hơn. Bản cập nhật giới thiệu cơ sở hạ tầng chuyển đổi cho mảng `rope_pattern`, hỗ trợ xác định RoPE (Rotary Position Embedding) theo từng lớp và xử lý các tham số MoE dưới dạng tùy chọn trong quá trình chuyển đổi. Nó cũng sửa lỗi logic mẫu cửa sổ trượt và quy ước đặt tên cho các đầu vào cổng mạng truyền thẳng (FFN).
## KIẾN THỨC NỀN
IBM Granite là một họ mô hình AI mở được thiết kế cho các ứng dụng doanh nghiệp. Chú ý Cửa sổ Trượt (SWA) là một cơ chế giới hạn sự chú ý vào một cửa sổ có kích thước cố định gồm các token lân cận, giúp giảm độ phức tạp tính toán của Transformer từ bậc hai xuống tuyến tính. Hỗn hợp Chuyên gia (MoE) là một kiến trúc chỉ kích hoạt một phần nhỏ các tham số của mô hình cho mỗi đầu vào, giúp nâng cao hiệu quả hoạt động.