~/GENERATIVE A/nvidia-s-64b-cosmos3-model-quantized-to-int4-for-local-mlx-and

Mô hình 64B Cosmos3 của NVIDIA được lượng hóa INT4 để chạy cục bộ trên MLX và CUDA

Các nhà phát triển cộng đồng đã phát hành bộ trọng số lượng hóa INT4 và mã nguồn suy luận cho mô hình Cosmos3 64 tỷ tham số của NVIDIA. Công trình này cho phép tạo ảnh từ văn bản và tạo video từ ảnh trực tiếp trên phần cứng cá nhân thông qua Apple MLX và NVIDIA CUDA. Việc chạy các mô hình thị giác 64B tiên tiến nhất cục bộ trước đây đòi hỏi các hệ thống GPU doanh nghiệp đắt đỏ, nhưng lượng hóa 4-bit đã giúp việc thực thi trên phần cứng cá nhân trở nên khả thi. Điều này giúp nhà phát triển và sáng tạo nội dung tự chủ dữ liệu, bảo đảm quyền riêng tư và thử nghiệm miễn phí mà không cần phụ thuộc vào API đám mây. Mô hình lượng hóa INT4 tạo một đoạn video ngắn trong khoảng 5 phút trên máy Mac M4 Max sở hữu 128 GB bộ nhớ hợp nhất. Dự án cung cấp sẵn trọng số trên Hugging Face cùng một kho lưu trữ GitHub chứa mã nguồn suy luận và bảng so sánh chất lượng đầu ra với Grok.

## KIẾN THỨC NỀN

NVIDIA Cosmos là nền tảng mô hình nền tảng thế giới thế hệ mới được thiết kế cho AI vật lý, robot và sáng tạo nội dung thị giác nâng cao. MLX là khung làm việc mảng mã nguồn mở của Apple được tối ưu hóa riêng cho kiến trúc bộ nhớ hợp nhất của chip Apple Silicon. Lượng hóa INT4 là kỹ thuật nén giúp chuyển đổi trọng số mô hình từ độ chính xác 16-bit xuống số nguyên 4-bit, giảm đáng kể dung lượng RAM và VRAM cần thiết để vận hành các mô hình AI khổng lồ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#generative-ai#local-ai#quantization#mlx#computer-vision

$ subscribe --daily

Mô hình 64B Cosmos3 của NVIDIA được lượng hóa INT4 để chạy cục bộ trên MLX và CUDA | Daily News