Lập trình viên xây dựng mô hình LLM 2B thử nghiệm kết hợp bảng Engram 1B và Tokenizer OLMo
Một lập trình viên độc lập đã chia sẻ cập nhật tiến độ huấn luyện mô hình LLM 2 tỷ tham số mã nguồn mở tuân thủ giấy phép Apache 2.0, tích hợp bảng tra cứu bộ nhớ Engram 1 tỷ tham số. Bằng cách kết hợp tokenizer OLMo với kỹ thuật chắt lọc tri thức xác suất từ mô hình 7B, kiến trúc tùy chỉnh này đã đạt được độ mạch lạc ngôn ngữ ban đầu chỉ sau 15 triệu token huấn luyện. Dự án cho thấy cách các nhà phát triển độc lập có thể vượt qua rào cản giấy phép bản quyền của LLaMA bằng cách tận dụng các thành phần mở hoàn toàn như OLMo từ Ai2. Nó cũng thử nghiệm các kiến trúc lai đổi mới, cho phép huấn luyện các mô hình ngôn ngữ có chiều sâu ngay trên GPU phổ thông với 24GB VRAM. Mô hình thu nhỏ `d_model` xuống 2048 để chứa 40 block chú ý cửa sổ trượt và chú ý toàn cục, đồng thời dành 50% tổng dung lượng cho bảng Engram N-gram tĩnh. Mô hình giữ lại khoảng 65% nội dung embedding gốc thông qua phép hạ chiều và tránh được hiện tượng lặp từ phổ biến ở giai đoạn đầu nhờ học phân phối xác suất mềm.
## KIẾN THỨC NỀN
OLMo là sáng kiến mô hình ngôn ngữ mở từ Viện Trí tuệ Nhân tạo Allen (Ai2), cung cấp mở trọng số, mã nguồn huấn luyện và tập dữ liệu theo các giấy phép tự do. Trong khi đó, Engram là kiến trúc Transformer bổ trợ bộ nhớ, giúp chuyển bớt việc lưu trữ mẫu ngôn ngữ tĩnh sang các bảng tra cứu N-gram để cân bằng giữa tính toán thần kinh và truy xuất nhanh.