~/LLM/developer-releases-bettergpt-150m-a-compact-152m-parameter-language-model

Nhà phát triển phát hành BetterGPT-150M, mô hình ngôn ngữ nhỏ gọn với 152 triệu tham số

Một nhà phát triển đã phát hành BetterGPT-150M, một mô hình ngôn ngữ nhân quả (causal language model) dung lượng nhẹ với 152 triệu tham số được huấn luyện trên 15 tỷ token. Mô hình này là mã nguồn mở, cung cấp trọng số tự do và đi kèm bản thử nghiệm trực tiếp trên Hugging Face Spaces. Mô hình này cung cấp một giải pháp thay thế hiệu quả cao cho các mô hình nhỏ cũ hơn như GPT-2, giúp nó trở nên lý tưởng cho điện toán biên (edge computing), suy luận nhanh trên CPU và thử nghiệm LLM dung lượng nhẹ. Nó chứng minh cách các tập dữ liệu và kỹ thuật huấn luyện hiện đại có thể tối đa hóa hiệu quả token trong các kiến trúc siêu nhỏ. BetterGPT-150M là một mô hình hoàn thành văn bản gốc (base completion model) chứ không phải mô hình tinh chỉnh theo hướng dẫn (instruction-tuned), được huấn luyện qua các giai đoạn ổn định và annealing (ủ nhiệt) trên các tập dữ liệu như FineWeb-Edu và Cosmopedia. Mô hình có mức tiêu thụ RAM và vRAM cực thấp, cho phép chạy tức thì trên các CPU thông thường.

## KIẾN THỨC NỀN

Trong quá trình huấn luyện LLM, giai đoạn annealing (ủ nhiệt) là một bước quan trọng (thường ở cuối quá trình huấn luyện) nơi tốc độ học (learning rate) được giảm dần hoặc dữ liệu được tái phân bổ trọng số để giúp mô hình hội tụ và cải thiện hiệu suất. Ngoài ra, Hugging Face ZeroGPU là một cơ sở hạ tầng chia sẻ giúp phân bổ động tài nguyên GPU để lưu trữ các bản demo AI một cách hiệu quả.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Edge AI#Open Source#Machine Learning

$ subscribe --daily