~/LLM/llama-cpp-adds-support-for-spark-x2-5-compact-1m-context-llms

llama.cpp Hỗ Trợ Dòng Mô Hình Thu Nhỏ Spark-X2.5 Ngữ Cảnh 1 Triệu Token

Một lượt pull request trên llama.cpp đã thêm sự hỗ trợ cho kiến trúc mô hình Spark-X2.5, giúp chạy được các mô hình Spark-X2.5-1.7B và Spark-X2.5-4B của XHToken. Các mô hình thu nhỏ này sở hữu cửa sổ ngữ cảnh nguyên bản lên tới 1 triệu token nhờ sử dụng kiến trúc chú ý lai (hybrid attention). Sự tích hợp này cho phép chạy cục bộ các mô hình ngữ cảnh siêu dài trực tiếp trên thiết bị cá nhân với mức tiêu thụ tài nguyên tối thiểu qua các công cụ như Ollama và LM Studio. Điều này giúp người dùng dễ dàng tiếp cận các mô hình dưới 5 tỷ tham số có hiệu năng cao cho công việc lập trình, đại lý AI (agentic workflows) và suy luận. Spark-X2.5 đạt được khả năng xử lý ngữ cảnh 1 triệu token nhờ kết hợp một lớp chú ý toàn cục (full-attention) với ba lớp chú ý cửa sổ trượt (sliding-window attention). Được huấn luyện trên cụm máy chủ Huawei Ascend bằng các kỹ thuật học tăng cường như MOPD, các mô hình này hỗ trợ triển khai đa nền tảng trên phần cứng NVIDIA, Huawei, Hygon và HOUMO.AI.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận C/C++ được sử dụng rộng rãi để chạy các mô hình ngôn ngữ lớn cục bộ trên phần cứng cá nhân. Cơ chế tự chú ý (self-attention) truyền thống yêu cầu bộ nhớ tăng theo hàm bình phương khi độ dài ngữ cảnh tăng lên, trong khi cơ chế chú ý cửa sổ trượt (sliding window attention) giới hạn tầm chú ý vào các nhóm token lân cận để giảm đáng kể lượng bộ nhớ khi xử lý ngữ cảnh dài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#llama.cpp#Long Context#Model Architecture#Open Source AI

$ subscribe --daily