~/MACHINE LEAR/engineer-trains-102m-recursive-bitnet-v2-model-with-64k-context

Lập trình viên huấn luyện mô hình BitNet-v2 đệ quy 102M với ngữ cảnh 64K

Một kỹ sư độc lập đã huấn luyện từ đầu một mô hình BitNet-v2 đệ quy 102 triệu tham số với cửa sổ ngữ cảnh 64K sử dụng chưa đến 5 tỷ token. Mô hình này kết hợp trọng số tam phân (ternary weights), các lớp transformer chia sẻ và embedding n-gram được băm với ngân sách rất nhỏ. Dự án này chứng minh cách các sự kết hợp mang tính thử nghiệm và tiết kiệm chi phí của kiến trúc LLM hiệu quả có thể tạo ra các mô hình hoạt động tốt với cửa sổ ngữ cảnh dài. Nó nêu bật tiềm năng của các phương pháp huấn luyện hạn chế tài nguyên trong cộng đồng AI mã nguồn mở. Mô hình transformer chỉ có bộ giải mã (decoder-only) này sở hữu 102,28 triệu tham số duy nhất, sử dụng sáu khối transformer chạy hai lần với trọng số được chia sẻ và tích hợp embedding 2, 3 và 4-gram được băm. Mô hình được huấn luyện qua hai giai đoạn bằng GPU NVIDIA B300 và đạt điểm trung bình benchmark zero-shot chưa trọng số là 40,59%.

## KIẾN THỨC NỀN

Mạng trọng số tam phân lượng tử hóa trọng số mô hình thành {-1, 0, +1}, giúp giảm đáng kể chi phí tính toán và mức sử dụng bộ nhớ. Embedding n-gram tích hợp rõ ràng các mẫu đa token vào mô hình, trong khi các lớp transformer đệ quy hoặc chia sẻ tái sử dụng các tham số theo chiều sâu để tăng dung lượng hiệu quả mà không làm tăng thêm các tham số duy nhất.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#LLM Architecture#BitNet#Model Training#Efficient AI

$ subscribe --daily

Lập trình viên huấn luyện mô hình BitNet-v2 đệ quy 102M với ngữ cảnh 64K | Daily News