Đánh giá thực tế mô hình AI cục bộ Gemma4-31B và Qwen3.8-27B trong lập trình
Một kỹ sư phần mềm đã đánh giá hai mô hình mã nguồn mở Gemma4-31B và Qwen3.8-27B (sử dụng lượng hóa 4-bit Unsloth) cùng mô hình GPT-6.1-Sol trong việc phân tích kho mã nguồn và tạo ứng dụng C#. Gemma4 cho thấy hiệu suất thực thi nhanh và tập trung hơn, trong khi Qwen3.8 kiên trì hơn và tạo ra mã nguồn chất lượng cao hơn sau khi hiệu chỉnh. Bài đánh giá này làm nổi bật sự đánh đổi thực tế giữa tốc độ, sự kiên trì và chất lượng đầu ra khi chạy các mô hình mã nguồn mở cục bộ trên phần cứng cá nhân cho công việc lập trình. Nó cũng cho thấy khoảng cách vẫn còn khá xa giữa các mô hình cục bộ lớp 30B và những mô hình AI thương mại hàng đầu hiện nay. Trong tác vụ phân tích mã nguồn, Gemma4 chỉ tốn khoảng 10 lần gọi máy chủ so với 20-30 lần của Qwen3.8 nhưng cho ra phân tích có độ sâu tương đương. Khi khởi tạo dự án nhiều tệp, Gemma4 đạt điểm B- và cần nhiều vòng lặp, Qwen3.8 đạt B+ chỉ sau 1 lần chỉnh sửa, còn GPT-6.1-Sol đạt A+ ngay lần thử đầu tiên.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn (LLM) mã nguồn mở có thể chạy trực tiếp trên phần cứng cá nhân, cho phép tạo mã nguồn ngoại tuyến mà không mất phí API hay lo ngại về bảo mật. Các phương pháp lượng hóa (quantization) như Unsloth 4-bit giúp nén trọng số mô hình xuống 4-bit, giảm đáng kể dung lượng VRAM yêu cầu để các mô hình 27B-31B chạy ổn định trên GPU máy tính.