Trực Tiếp Quá Trình Tinh Chỉnh Mô Hình LLM 80B Tại Nhà Của Nhà Phát Triển Độc Lập
Một nhà phát triển trên Reddit (u/jjusko20) đang phát trực tiếp thử nghiệm tinh chỉnh (post-train) mô hình nền tảng AliceAI-Foundation-80B thành mô hình tuân thủ chỉ lệnh (instruct) ngay tại nhà bằng các GPU Nvidia V100 thế hệ cũ. Quy trình huấn luyện này sử dụng bộ dữ liệu tổng hợp gồm 3.340 mẫu được chắt lọc (distilled) từ mô hình Qwen 3.8 27B sau 96 giờ tạo dữ liệu liên tục. Dự án này thể hiện mức độ khả thi của việc tinh chỉnh mô hình ngôn ngữ lớn và chắt lọc dữ liệu đối với các cá nhân đam mê công nghệ ngay cả khi sử dụng phần phần cứng doanh nghiệp thế hệ cũ. Nó cũng cho thấy xu hướng phát triển của việc công khai và phát trực tiếp thời gian thực quá trình huấn luyện các mô hình AI trong cộng đồng mã nguồn mở. Nhà phát triển đang tinh chỉnh một adapter QLoRA rank-16 chỉ can thiệp vào các ma trận chiếu q/k/v/o trong 2 epoch, dự kiến giai đoạn tinh chỉnh có giám sát (SFT) sẽ kéo dài từ 3 đến 6 ngày trước khi chuyển sang học tăng cường (RL). Bộ dữ liệu bao gồm 1.760 mẫu chỉ lệnh chung và 1.580 mẫu về tác tử kỹ thuật phần mềm được tạo thông qua môi trường sử dụng công cụ sandbox Python.
## KIẾN THỨC NỀN
Quá trình tinh chỉnh (post-training) chuyển đổi một mô hình LLM cơ bản chỉ có khả năng hoàn thành văn bản thành một trợ lý biết tuân thủ chỉ lệnh, có khả năng đối thoại nhiều lượt và gọi hàm có cấu trúc. Chắt lọc dữ liệu tổng hợp tận dụng các mô hình AI lớn hơn hoặc chuyên biệt để tạo ra các ví dụ huấn luyện chất lượng cao, thay thế cho việc dán nhãn dữ liệu thủ công tốn kém bởi con người.