JetBrains Ra Mắt Mô Hình AI Lập Trình Mã Nguồn Mở Mellum2.1 Tối Ưu Cho Agent
JetBrains đã chính thức phát hành Mellum2.1, một mô hình AI mã nguồn mở (giấy phép Apache 2.0) sử dụng kiến trúc Mixture-of-Experts 12B với 2,5B tham số kích hoạt được tối ưu cho lập trình dạng agent. Mô hình mang lại những cải tiến lớn về học tăng cường sau huấn luyện và đạt hiệu suất suy luận ở tải cao gần gấp đôi so với Qwen3.5-9B. Mellum2.1 cho phép các nhà phát triển và doanh nghiệp vận hành các agent lập trình mã nguồn mở với tốc độ cao ngay trên hạ tầng cục bộ hoặc riêng tư mà không làm ảnh hưởng đến bảo mật dữ liệu. Khả năng hoạt động tự chủ nâng cao giúp mô hình tự chẩn đoán các bài kiểm thử bị lỗi, soạn thảo giải pháp sửa lỗi và xác minh các thay đổi trên toàn bộ hệ thống mã nguồn. Nhờ ứng dụng kỹ thuật Dự đoán Đa Token (Multi-Token Prediction - MTP), Mellum2.1 tăng tốc độ xử lý đơn yêu cầu lên 1,6 lần trong khi vẫn duy trì băng thông cao khi xử lý lượng lớn yêu cầu đồng thời. JetBrains đã huấn luyện mô hình bằng hàng triệu lượt chạy trong môi trường sandbox phục vụ học tăng cường, đồng thời thông báo sẽ sớm hỗ trợ định dạng GGUF và giải mã suy đoán MTP trên vLLM.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) điều hướng yêu cầu đến các mạng con chuyên biệt bên trong mô hình, chỉ kích hoạt một phần nhỏ tổng số tham số nhằm giảm đáng kể yêu cầu phần cứng khi suy luận. Trong khi đó, Dự đoán Đa Token (Multi-Token Prediction - MTP) là một giải pháp tối ưu hóa suy luận, giúp mô hình dự đoán nhiều token tiếp theo cùng lúc thay vì chỉ sinh từng token một như thông thường.