Chuyển bộ nhớ N-Gram huấn luyện sẵn sang Qwen3.5-0.8B giúp giảm 5.05% độ nhiễu loạn
Nhà phát triển độc lập Ninnix đã tạo ra Qwengram-0.8B, một kỹ thuật chuyển bộ nhớ n-gram Tăng cường Ngôn ngữ Dự đoán (PLE) khoảng 51 tỷ tham số từ Qwen3.8-Flash-Next vào mô hình Qwen3.5-0.8B được đóng băng. Bằng cách huấn luyện một bộ đọc siêu nhẹ cùng cổng điều hướng động theo cấp độ token mà không cần tinh chỉnh mô hình nền, phương pháp này đã giảm 5,05% độ nhiễu loạn (perplexity) trên tập kiểm định. Dự án này chứng minh rằng các mô hình ngôn ngữ nhỏ có thể được nâng cấp đáng kể bằng cách gắn thêm bộ nhớ n-gram ngoại vi quy mô lớn mà không cần thay đổi trọng số của mô hình gốc. Phương pháp này mang lại một hướng đi tiết kiệm tài nguyên để cải thiện độ chính xác của các LLM nhỏ ngay trên các phần cứng cấu hình thấp như GPU Kaggle miễn phí. Cấu hình này kết hợp mô hình 0,8B được đóng băng với bộ nhớ phụ PLE 51B bên ngoài, chỉ huấn luyện mô-đun đọc R=1 ở tầng giải mã 3 và 9 cùng một cổng tuyến tính động trên 15 triệu token. Luồng suy luận đã được thực thi trên phiên bản llama.cpp tùy chỉnh, trong đó định dạng lượng hóa 8-bit (Q8_0) giữ lại được 99,1% mức giảm loss so với độ chính xác BF16.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ n-gram lưu trữ tần suất chuỗi token để dự đoán xác suất của các từ tiếp theo dựa trên ngữ cảnh đã qua. Cơ chế Tăng cường Ngôn ngữ Dự đoán (PLE) sử dụng các bảng n-gram khổng lồ bên ngoài làm cấu trúc bộ nhớ tường minh để bổ trợ cho trọng số mạng thần kinh. Độ nhiễu loạn (Perplexity - PPL) đo lường khả năng dự đoán văn bản của mô hình, trong đó chỉ số càng thấp thể hiện hiệu suất mô hình càng tốt.