~/LOCAL LLMS/laguna-xs-2-1-llm-shows-strong-coding-performance-on-low-resource

Mô hình Laguna XS 2.1 mang lại hiệu năng lập trình ấn tượng trên phần cứng cấu hình thấp

Một người dùng đã chia sẻ kết quả hiệu năng tích cực khi chạy mô hình Laguna XS 2.1 trên máy tính xách tay có VRAM 8 GB, đạt tốc độ 30 token mỗi giây với cửa sổ ngữ cảnh 60k. Mô hình này đã tạo thành công mã nguồn trò chơi có thể chơi được chỉ trong một lần thử (one-shot), vượt trội hơn một số mô hình lớn hơn như Gemma và Qwen trong cấu hình này. Điều này làm nổi bật khả năng chạy các mô hình Mixture-of-Experts (MoE) tiên tiến trên phần cứng phổ thông, giúp các nhà phát triển không có GPU đắt tiền vẫn có thể tiếp cận việc phát triển AI cục bộ và hỗ trợ lập trình. Nó chứng minh rằng số lượng tham số hoạt động (active parameters) nhỏ hơn vẫn có thể mang lại khả năng lập trình cạnh tranh tại địa phương. Laguna XS 2.1 là mô hình MoE có tổng cộng 33 tỷ tham số (33B) do Poolside phát triển, nhưng chỉ kích hoạt 3 tỷ tham số (3B) cho mỗi token, giúp giảm đáng kể yêu cầu về bộ nhớ và tính toán. Mặc dù một số người dùng báo cáo lỗi lặp (looping) thỉnh thoảng xảy ra, mô hình này đã hỗ trợ ngay từ ngày đầu ra mắt trên các môi trường chạy phổ biến như Llama.cpp, vLLM và TensorRT-LLM.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là một kiến trúc AI định tuyến các đầu vào đến các mạng con chuyên biệt (chuyên gia) thay vì kích hoạt toàn bộ mô hình cho mỗi token. Điều này cho phép mô hình có dung lượng lớn (ví dụ: tổng cộng 33B tham số) trong khi vẫn duy trì tốc độ và yêu cầu phần cứng thấp của một mô hình nhỏ hơn nhiều (ví dụ: 3B tham số hoạt động). Kiến trúc này rất có lợi cho các nhà phát triển chạy LLM cục bộ trên phần cứng phổ thông.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#LLM Inference#Consumer Hardware#Open Source AI

$ subscribe --daily

Mô hình Laguna XS 2.1 mang lại hiệu năng lập trình ấn tượng trên phần cứng cấu hình thấp | Daily News