Cập nhật tiến trình tinh chỉnh mô hình AliceAI 80B-A3B của Yandex
Người dùng Reddit jjusko20 đã chia sẻ cập nhật tiến trình tinh chỉnh mô hình nền tảng AliceAI 80B-A3B của Yandex, đạt khoảng 40% chặng đường của đợt huấn luyện ban đầu. Bản cập nhật bao gồm biểu đồ đường cong mất mát (loss curve) được ghi lại từ tiểu bước (micro-step) cuối cùng của mỗi chu kỳ cùng với liên kết phát trực tiếp quá trình huấn luyện. Các nỗ lực tinh chỉnh của cộng đồng trên những mô hình trọng số mở dung lượng lớn giúp các nhà nghiên cứu và phát triển độc lập đánh giá quy trình hậu huấn luyện thực tế trên kiến trúc Mixture-of-Experts (MoE). Việc chia sẻ đường cong mất mát và luồng phát trực tiếp giúp cung cấp tài liệu tham khảo thực nghiệm minh bạch cho các kỹ sư đang tinh chỉnh các mô hình MoE lớn. Các biến động trên đường cong mất mát được giải thích bằng cách lấy mẫu chỉ số cụ thể từ micro-step cuối cùng của mỗi bước, với sự trợ giúp thiết lập từ Gemini 3.8 Flash High. Mục tiêu huấn luyện là mô hình gốc AliceAI-Foundation-80B-A3B phát hành theo giấy phép Apache 2.0 của Yandex.
## KIẾN THỨC NỀN
Yandex đã mở mã nguồn mô hình ngôn ngữ nền tảng AliceAI-Foundation-80B-A3B theo giấy phép Apache 2.0 với kiến trúc lai Mixture-of-Experts (MoE). Mô hình có tổng cộng 80 tỷ tham số nhưng chỉ kích hoạt 3 tỷ tham số cho mỗi token trong quá trình suy luận, đồng thời hỗ trợ độ dài ngữ cảnh lên tới 262.144 token. Kiến trúc MoE định tuyến các token đầu vào một cách linh hoạt đến các mạng con chuyên biệt, giúp giảm đáng kể yêu cầu tính toán thực tế so với các mô hình dày (dense) truyền thống.