~/LLM FINE TUN/developer-shares-post-training-challenges-distilling-chain-of-thought-into-aliceai-80b

Nhà phát triển chia sẻ thách thức hậu huấn luyện chắt lọc tư duy chuỗi cho AliceAI-80B

Một nhà phát triển mã nguồn mở đã chia sẻ tiến trình tinh chỉnh mô hình AliceAI-80B-A3B của Yandex tại địa phương bằng 3 GPU Nvidia V100 32GB. Sau khi đợt tinh chỉnh có giám sát (SFT) đầu tiên với 5 triệu token cho thấy mô hình bị thiếu dữ liệu nghiêm trọng cho hội thoại chung, tác giả đang mở rộng quy trình tạo dữ liệu tổng hợp bằng công cụ mã nguồn mở sftmill. Thử nghiệm thực tế này minh họa tính khả thi cũng như yêu cầu về độ rộng của tập dữ liệu token khi hậu huấn luyện các mô hình Hỗn hợp chuyên gia (MoE) trên phần cứng doanh nghiệp thế hệ cũ. Nó cho thấy các công cụ chắt lọc tri thức ngoài chính sách có thể giúp các nhà phát triển cá nhân truyền tải khả năng lý luận chuyên sâu cho mô hình mã nguồn mở. Điểm kiểm tra (checkpoint) đầu tiên đã tiếp thu thành công lý luận theo chuỗi tư duy cơ bản nhưng tạo ra đầu ra bị lỗi đối với các câu hỏi hội thoại mơ hồ do tập dữ liệu ban đầu quá hẹp và quá chú trọng vào lập trình. Để khắc phục, tốc độ tạo dữ liệu tổng hợp đã được tăng gấp ba lên 240 token/giây trên nhiều tiến trình song song nhằm chuẩn bị thêm 5 triệu token hướng dẫn tổng quát cho đợt huấn luyện tiếp theo.

## KIẾN THỨC NỀN

AliceAI-Foundation-80B-A3B-Base của Yandex là mô hình cơ sở mã nguồn mở sử dụng kiến trúc Hỗn hợp chuyên gia (MoE) với tổng cộng 80 tỷ tham số, trong đó có 3 tỷ tham số kích hoạt cho mỗi token. Chắt lọc mô hình (distillation) và Tinh chỉnh có giám sát (SFT) cho phép nhà phát triển tinh chỉnh các mô hình cơ sở bằng cách huấn luyện chúng trên dữ liệu tổng hợp từ các mô hình thầy mạnh hơn để truyền tải khả năng lý luận và tuân thủ hướng dẫn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Fine-Tuning#Model Distillation#LocalLLaMA#Open Source AI

$ subscribe --daily

Nhà phát triển chia sẻ thách thức hậu huấn luyện chắt lọc tư duy chuỗi cho AliceAI-80B | Daily News