Nhà phát triển đề xuất mô hình LLM dày 9,4B kết hợp Engram, AttnRes và NoPE/RoPE
Một nhà phát triển nguồn mở độc lập đã giới thiệu kiến trúc LLM dạng dày 9,4B tham số được thiết kế để huấn luyện trên một GPU duy nhất, đồng thời thu thập ý kiến cộng đồng trước khi tiến hành huấn luyện. Mô hình này tích hợp bảng bộ nhớ Engram của DeepSeek, kết nối Attention Residuals (AttnRes) của Moonshot AI, tỷ lệ lớp RoPE:NoPE là 3:1 và chắt lọc tri thức từ Llama 3. Dự án này cho thấy các nhà nghiên cứu độc lập có thể kết hợp các cải tiến kiến trúc tiên tiến nhất trên phần cứng cá nhân thông qua chắt lọc tri thức và tối ưu hóa mã nguồn. Nếu hoàn thành, dự án có thể cung cấp cho cộng đồng AI một mô hình lớp 9B nguồn mở vượt qua các giới hạn thiết kế Transformer tiêu chuẩn. Tác giả đã tối ưu hóa quy trình huấn luyện dành riêng cho một GPU RTX 6000 Pro duy nhất, sử dụng dữ liệu trích xuất ở cấp độ logit từ mô hình giáo viên Llama 3 để đơn giản hóa quá trình tiền huấn luyện. Toàn bộ trọng số, tập dữ liệu và mã nguồn sẽ được mở hoàn toàn, đồng thời tác giả cũng đã gửi đóng góp sửa lỗi cho vLLM giúp tăng tốc độ tải prompt từ 10 đến 100 lần.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ hiện đại ngày càng áp dụng nhiều cải tiến kiến trúc vượt ra ngoài Transformer truyền thống. Mô-đun Engram của DeepSeek bổ sung các bảng tra cứu bộ nhớ N-gram tĩnh để giảm tải nhu cầu lưu trữ tri thức cho các lớp tính toán, trong khi Attention Residuals (AttnRes) của Moonshot AI thay thế các kết nối residual cố định bằng cơ chế chú ý học được theo chiều sâu. Ngoài ra, thiết kế lai giữa RoPE và NoPE cho phép xen kẽ các lớp có mã hóa vị trí và không có mã hóa vị trí nhằm cải thiện khả năng xử lý ngữ cảnh dài.