~/LLAMA CPP/real-time-ngram-knowledge-injector-for-qwen-models-created-for-llama-cpp

Công cụ tiêm tri thức Ngram thời gian thực cho mô hình Qwen trên llama.cpp

Lập trình viên Alfredo Ortega đã phát triển một bản rẽ nhánh tùy chỉnh của llama.cpp cùng công cụ đi kèm cho phép thay thế (hot-swap) tri thức trực tiếp vào bảng nhúng Ngram PLE của mô hình Qwen trong bộ nhớ theo thời gian thực. Điều này cho phép người dùng nạp dữ liệu mới vào mô hình đang chạy mà không cần tải lại. Thử nghiệm kỹ thuật này mang lại một giải pháp thay thế mới cho phương pháp tinh chỉnh (fine-tuning) hoặc RAG bằng cách thay đổi động bộ nhớ của mô hình theo thời gian thực. Nếu được hoàn thiện, nó có thể giúp các LLM chạy cục bộ sở hữu bộ nhớ dài hạn có thể cập nhật tức thì với chi phí tính toán tối thiểu. Do việc tiêm tri thức diễn ra ở các lớp nhúng ban đầu của mô hình, việc kiểm soát chính xác đầu ra được tạo ra vẫn còn nhiều thách thức. Phương pháp này hiện phụ thuộc vào tính năng ánh xạ bộ nhớ (`mmap`) của llama.cpp và mới chỉ được kiểm thử trên định dạng lượng hóa Q8, đòi hỏi lượng RAM khá lớn.

## KIẾN THỨC NỀN

Việc tiêm tri thức vào các mô hình ngôn ngữ lớn thường diễn ra trong quá trình tiền huấn luyện, tinh chỉnh sau huấn luyện, hoặc thông qua việc chèn ngữ cảnh của RAG. Các kiến trúc mô hình mới hơn như Qwen có các bảng N-gram PLE (Parametric Lookup Engine) giúp xử lý các truy xuất nhúng thưa. Do các bảng này được định địa chỉ xác định và cập nhật theo mỗi prompt, việc chỉnh sửa nội dung của chúng trong bộ nhớ sẽ thay đổi động cách biểu diễn token và khái niệm.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LocalLLaMA#Knowledge Injection#Qwen#Open Source AI

$ subscribe --daily

Công cụ tiêm tri thức Ngram thời gian thực cho mô hình Qwen trên llama.cpp | Daily News