~/MACHINE LEAR/mini-agi-a-dynamically-growing-continual-learning-model-trained-on-8gb-vram

mini-AGI: Mô hình học liên tục tự tăng trưởng huấn luyện trên GPU 8GB VRAM

Nhà phát triển /u/Another__one đã ra mắt "mini-AGI", một dự án mã nguồn mở thử nghiệm mô hình ngôn ngữ tự tăng trưởng kích thước (hiện đạt 530 triệu tham số) được huấn luyện từ đầu trên laptop có VRAM 8GB. Hệ thống này kết hợp cơ chế quản lý Mixture-of-Experts (MoE) động với phương pháp huấn luyện luồng dữ liệu batch-1 trên bộ dữ liệu 7,8 tỷ ký tự. Quá trình tiền huấn luyện các mô hình ngôn ngữ lớn thường đòi hỏi cụm GPU đắt tiền để đáp ứng nhu cầu bộ nhớ khổng lồ cho gradient và xử lý batch. Thử nghiệm này mở ra phương pháp tiềm năng giúp các nhà phát triển cá nhân tự huấn luyện và tinh chỉnh các mô hình tùy biến hoàn toàn trên phần cứng phổ thông chi phí thấp. Nhờ xử lý dữ liệu luồng liên tục theo từng đoạn 32K ký tự với batch size bằng 1, kiến trúc này tối thiểu hóa việc sử dụng VRAM bằng cách loại bỏ việc lưu trữ gradient của batch lớn. Các chuyên gia (experts) MoE không hoạt động sẽ được tải linh hoạt lên ổ cứng, cho phép tổng số tham số mô hình tăng lên mà chỉ bị giới hạn bởi dung lượng ổ đĩa.

## KIẾN THỨC NỀN

Học liên tục (continual learning) là một phương pháp trí tuệ nhân tạo cho phép mô hình tích lũy và cập nhật tri thức mới theo thời gian mà không làm mất đi tri thức đã học trước đó. Trong khi đó, kiến trúc Mixture-of-Experts (MoE) điều hướng dữ liệu đầu vào đến các mạng con chuyên biệt, chỉ kích hoạt một phần nhỏ tổng số tham số trong mỗi bước tính toán để tiết kiệm tài nguyên.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#Continual Learning#Local AI#Model Training#Open Source

$ subscribe --daily

mini-AGI: Mô hình học liên tục tự tăng trưởng huấn luyện trên GPU 8GB VRAM | Daily News