Huấn luyện mô hình LLM 1,1 tỷ tham số từ đầu chỉ với 200 USD
Một nhà phát triển đã huấn luyện thành công mô hình LLM 1,1 tỷ tham số dựa trên Gemma từ đầu với 20 tỷ token chỉ với khoảng 200 USD, sau đó tinh chỉnh bằng LoRA. Tác giả đã mở nguồn mã nguồn, trọng số mô hình dưới định dạng safetensors và GGUF, đồng thời cung cấp một trang web demo trực tuyến. Dự án này chứng minh rằng việc huấn luyện trước các mô hình ngôn ngữ nhỏ tùy chỉnh từ đầu là rất dễ tiếp cận và tiết kiệm chi phí cho các nhà phát triển cá nhân. Nó cung cấp một bản thiết kế thực tế và các tài nguyên mã nguồn mở cho việc thử nghiệm và học tập AI với ngân sách thấp. Kiến trúc của mô hình dựa trên Gemma 3 nhưng được sửa đổi với độ dài ngữ cảnh ngắn hơn là 4096, không sử dụng cơ chế chú ý cửa sổ trượt (sliding window attention) và từ vựng nhỏ hơn ở mức 32k. Quá trình huấn luyện trước được thực hiện trên vast.ai bằng GPU H100 trong 130 giờ, tiếp theo là tinh chỉnh LoRA trên RTX 3060 trong 52 giờ.
## KIẾN THỨC NỀN
Huấn luyện trước một mô hình ngôn ngữ lớn (LLM) từ đầu bao gồm việc huấn luyện nó trên một kho văn bản khổng lồ để học các mẫu ngôn ngữ chung, việc này thường đòi hỏi tài nguyên tính toán lớn. LoRA (Low-Rank Adaptation) là một kỹ thuật tinh chỉnh hiệu quả về tham số, cho phép các nhà phát triển điều chỉnh các mô hình đã được huấn luyện trước này cho các tác vụ cụ thể, như trò chuyện, với chi phí tính toán cực kỳ thấp.