Thắc mắc của cộng đồng về các mô hình ngôn ngữ nhỏ sử dụng kiến trúc N-Gram
Một người dùng trên diễn đàn LocalLLaMA đã đưa ra thắc mắc liệu có mô hình ngôn ngữ nhỏ mã nguồn mở nào dưới 9 tỷ tham số đang được huấn luyện hoặc phát hành bằng kỹ thuật n-gram hay không. Bài viết ghi nhận sự thiếu vắng các mô hình công khai trên các nền tảng như Hugging Face để so sánh trực tiếp hiệu năng khi có và không áp dụng n-gram. Việc khám phá các phương pháp thống kê nền tảng như n-gram kết hợp với mạng thần kinh hiện đại có thể dẫn đến các kiến trúc lai mang lại hiệu quả tính toán cao cho các mô hình nhỏ. Những kỹ thuật thử nghiệm này rất có giá trị đối với các nhà phát triển mã nguồn mở nhằm tối ưu hóa hiệu năng chạy cục bộ trên phần cứng giới hạn. Thắc mắc này tập trung cụ thể vào các mô hình thực nghiệm quy mô nhỏ (từ 9 tỷ tham số trở xuống) để xem các thử nghiệm so sánh trên cùng một bộ dữ liệu. Hiện tại, các ví dụ triển khai kết hợp cơ chế n-gram cổ điển với kiến trúc transformer vẫn còn rất hạn chế trên các kho mô hình công khai.
## KIẾN THỨC NỀN
N-gram là một chuỗi liên tiếp gồm n phần tử từ một mẫu văn bản, được sử dụng trong các mô hình ngôn ngữ thống kê truyền thống để dự đoán từ tiếp theo dựa trên ngữ cảnh phía trước. Mặc dù các mạng thần kinh sâu đã thay thế phần lớn các mô hình n-gram thống kê nhờ khả năng xử lý ngữ cảnh dài và khái quát hóa ngữ nghĩa vượt trội, các nhà nghiên cứu đôi khi vẫn xem xét lại các phương pháp kết hợp để nâng cao hiệu suất mô hình.