DynamicTune giúp mô hình 0.8B vượt qua mô hình 2B mà không cần lan truyền ngược
Các nhà nghiên cứu đã giới thiệu DynamicTune, một phương pháp phẫu thuật trọng số dạng đóng không cần lan truyền ngược để truyền các động lực lý luận từ mô hình thầy lớn hơn sang Qwen3.5-0.8B trong khoảng 12 phút trên phần cứng phổ thông. Mô hình 0.8B sau điều chỉnh đã đạt độ chính xác chuẩn hóa 42.15% trên bộ kiểm thử ARC-Challenge, vượt qua cả phương pháp tinh chỉnh có giám sát (SFT) truyền thống lẫn mô hình gốc lớn hơn là Qwen3.5-2B (41.10%). Phương pháp này thách thức quan niệm truyền thống rằng quy mô tham số và lan truyền ngược dựa trên độ dốc là điều kiện bắt buộc để nâng cao năng lực lý luận ở các mô hình ngôn ngữ nhỏ. Bằng cách cho phép truyền nạp tri thức nhanh chóng trên một GPU phổ thông duy nhất mà không cần dữ liệu huấn luyện hay hạ độ dốc, nó giảm đáng kể rào cản phần cứng đối với việc tối ưu hóa LLM. Để ngăn chặn sự sụp đổ biểu diễn do entropy phổ cao ở các lớp trung gian, DynamicTune chỉ giới hạn phẫu thuật trọng số trên 4 lớp neo thưa thớt (lớp 0, 7, 15 và 23) bằng giải pháp giả nghịch đảo Levenberg-Marquardt Tikhonov kết hợp cắt giảm hạng phổ thích ứng. Kết quả kiểm thử đã được xác minh độc lập bởi TPN Bench trên GPU NVIDIA L4 thuộc trung tâm dữ liệu thông qua khung lm_eval tiêu chuẩn với mức tăng mang ý nghĩa thống kê đạt 3.23-sigma.
## KIẾN THỨC NỀN
Bộ kiểm thử ARC-Challenge (Abstraction and Reasoning Corpus Challenge) đo lường khả năng lý luận đa bước phức tạp của hệ thống AI bằng cách loại bỏ các câu hỏi truy xuất thông tin đơn giản. Quá trình thích ứng mô hình tiêu chuẩn thường dựa vào tinh chỉnh có giám sát (SFT) hoặc hợp nhất mô hình, vốn đòi hỏi lan truyền ngược và tài nguyên tính toán GPU rất lớn, trong khi phẫu thuật trọng số dạng đóng áp dụng các phép biến đổi đại số tuyến tính giải tích trực tiếp lên ma trận tham số.