Bản Fine-Tune Qwen3.8 Ứng Dụng Lý Thuyết Ma Trận Ngẫu Nhiên Để Lọc Nhiễu Trọng Số LLM
Người dùng Reddit EvilEnginer đã phát hành mô hình Qwen3.8-27B-Uncensored-Genesis-V1-GGUF, một bản fine-tune thử nghiệm áp dụng định luật Marchenko-Pastur từ lý thuyết ma trận ngẫu nhiên để lọc nhiễu số trong các ma trận trọng số tensor. Dự án nhằm mục đích giải quyết vấn đề mô hình suy luận quá đà và tạo ra những đoạn văn dài không cần thiết cho các tác vụ đơn giản. Các mô hình ngôn ngữ lớn thường gặp khó khăn với tình trạng mất ổn định số liệu và tích tụ nhiễu nội bộ, dẫn đến việc tiêu tốn token và sinh ra văn bản quá dài trong quá trình suy luận. Việc áp dụng các nguyên lý toán học chặt chẽ như phân phối Marchenko-Pastur có thể mang lại một phương pháp mới giúp lọc trọng số và tối ưu hóa tham số với chi phí thấp. Tác giả đã điều chỉnh các khái niệm lọc nhiễu từ một bài báo toán-vật lý năm 2013 để làm sạch nhiễu huấn luyện trực tiếp khỏi các ma trận trọng số. Mô hình đã được chuyển đổi sang định dạng GGUF và chia sẻ với cộng đồng để đánh giá hiệu năng do tác giả bị giới hạn bởi phần cứng tầm trung (RTX 3060 với 12GB VRAM).
## KIẾN THỨC NỀN
Phân phối Marchenko-Pastur là một khái niệm nền tảng trong lý thuyết ma trận ngẫu nhiên, mô tả hành vi tiệm cận của các giá trị đơn lẻ (singular values) trong ma trận ngẫu nhiên kích thước lớn. Trong học máy, các nhà nghiên cứu sử dụng lý thuyết ma trận ngẫu nhiên để phân biệt tín hiệu tham số có ý nghĩa với nhiễu ngẫu nhiên tích tụ trong quá trình huấn luyện, cho phép cắt tỉa trọng số và căn chỉnh mô hình một cách hiệu quả.