llama.cpp Bổ Sung Các Thao Tác Mới Hỗ Trợ Mô Hình Thử Nghiệm Qwen 4
Pull Request #28901 trên `llama.cpp` bổ sung các thao tác tensor mới (`hc ops`) được thiết kế riêng cho kiến trúc thử nghiệm `qwen4exp`. Sự nâng cấp này cho phép người dùng chạy và đánh giá hiệu năng (benchmark) các phiên bản mô hình xem trước của Qwen, chẳng hạn như Qwen 3.8-Flash-Next. Việc hỗ trợ sớm các kiến trúc thế hệ tiếp theo trong các công cụ như `llama.cpp` cho phép giới phát triển trải nghiệm trước các tính năng mới trước khi mô hình chính thức ra mắt. Điều này thúc đẩy quá trình thử nghiệm và tối ưu hóa hiệu năng từ cộng đồng cho dòng mô hình Qwen 4 sắp tới của Alibaba. Pull request này triển khai các phép toán còn thiếu mà kiến trúc thử nghiệm Qwen 4 yêu cầu trong backend `ggml`. Điều này đảm bảo việc cấp phát bộ nhớ và đồ thị tính toán diễn ra chính xác cho các biến thể như Qwen 3.8-Flash-Next.
## KIẾN THỨC NỀN
`llama.cpp` là một framework C++ hiệu năng cao được thiết kế để chạy suy luận LLM cục bộ trên các phần cứng CPU và GPU. Qwen 3.8-Flash-Next đóng vai trò là bản xem trước sớm của kiến trúc Qwen 4 từ Alibaba, được phát hành để các nhà phát triển mã nguồn mở chuẩn bị trước cho dòng mô hình chính thức. Việc bổ sung các thao tác tensor tùy chỉnh vào `llama.cpp` là cần thiết mỗi khi một kiến trúc mới giới thiệu các lớp hoặc phép toán đại số khác biệt.