~/META/meta-open-sources-muse-glimmer-a-30b-local-agent-model-running-on

Meta ra mắt mã nguồn mở Muse Glimmer, mô hình AI 30B chạy trên GPU 24GB VRAM

Meta đã phát hành mã nguồn mở Muse Glimmer dưới giấy phép Apache 2.0, một mô hình AI đa phương thức 30 tỷ tham số được tối ưu hóa cho các luồng công việc của tác nhân (agent) cục bộ. Nhờ kỹ thuật lượng tử hóa 4-bit, mô hình này có thể chạy trực tiếp trên các thiết bị phần cứng tiêu dùng có VRAM 24GB hoặc 32GB như máy tính Mac và PC. Việc phát hành này cho phép các nhà phát triển chạy các luồng công việc AI dạng tác nhân (agentic) có năng lực cao hoàn toàn cục bộ trên phần cứng tiêu dùng mà không cần phụ thuộc vào API đám mây. Điều này giúp giảm rào cản trong việc triển khai các tác nhân AI riêng tư, hoạt động liên tục, có khả năng gọi công cụ phức tạp và suy luận đa bước. Muse Glimmer sở hữu kiến trúc đa phương thức hỗ trợ xen kẽ văn bản và hình ảnh, đồng thời đi kèm với một bộ dự thảo (drafter) dựa trên DFlash gọn nhẹ để giải mã đầu cơ (speculative decoding) nhằm tăng tốc độ suy luận. Mô hình được huấn luyện đặc biệt cho các tác vụ tác nhân, bao gồm suy luận đa bước, gọi hàm chính xác và tự phục hồi khi công cụ gặp lỗi.

## KIẾN THỨC NỀN

Các tác nhân AI (AI agents) là các hệ thống tự trị được thiết kế để thực hiện các tác vụ đa bước, sử dụng các công cụ bên ngoài và đưa ra quyết định để đạt được các mục tiêu cụ thể. Việc chạy các mô hình lớn (như mô hình 30 tỷ tham số) trên máy cục bộ thường đòi hỏi bộ nhớ rất lớn, nhưng các kỹ thuật lượng tử hóa (quantization) giúp nén trọng số mô hình (ví dụ: xuống 4-bit) để giảm đáng kể yêu cầu VRAM mà hầu như không làm giảm hiệu năng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Meta#Open Source#Large Language Models#AI Agents#Local LLMs

$ subscribe --daily

Meta ra mắt mã nguồn mở Muse Glimmer, mô hình AI 30B chạy trên GPU 24GB VRAM | Daily News