Cộng đồng kêu gọi phát triển mô hình Qwen cỡ trung thay vì mô hình nghìn tỷ tham số
Một cuộc thảo luận trên Reddit nhấn mạnh nhu cầu ngày càng tăng đối với việc các phòng nghiên cứu AI như Alibaba phát hành các mô hình mở (open-weights) cỡ trung có năng lực cao, dao động từ 27 tỷ đến 397 tỷ tham số. Người dùng lập luận rằng các kích thước này thực tế hơn nhiều đối với việc triển khai cục bộ trên phần cứng tiêu dùng so với các mô hình khổng lồ hàng nghìn tỷ tham số. Mặc dù các mô hình nghìn tỷ tham số thúc đẩy giới hạn năng lực của AI, chúng lại nằm ngoài tầm với của các nhà phát triển cá nhân và cộng đồng AI cục bộ do yêu cầu phần cứng cực kỳ khắt khe. Việc ưu tiên các mô hình cỡ trung đảm bảo rằng sự đổi mới sáng tạo mã nguồn mở vẫn khả thi đối với những người đam mê và các nhà nghiên cứu không có cơ sở hạ tầng cấp doanh nghiệp. Các mô hình cỡ trung, đặc biệt là kiến trúc Mixture of Experts (MoE), có thể chạy trên các hệ thống tiêu dùng bằng cách sử dụng các kỹ thuật như CPU expert offloading, giúp lưu trữ các chuyên gia không hoạt động trong RAM hệ thống để giảm đáng kể mức sử dụng VRAM của GPU. Tác giả lưu ý rằng các mô hình mở khổng lồ chủ yếu mang lại lợi ích cho các tập đoàn lớn có cơ sở hạ tầng để vận hành chúng, thay vì những người đam mê công nghệ tại địa phương.
## KIẾN THỨC NỀN
Qwen là một dòng mô hình ngôn ngữ lớn được phát triển bởi Alibaba Cloud. Khi các mô hình phát triển lên tới hàng trăm tỷ hoặc hàng nghìn tỷ tham số, việc chạy chúng cục bộ trở nên bất khả thi nếu không có GPU cấp doanh nghiệp. Các kỹ thuật như CPU expert offloading giúp giảm thiểu điều này trong các mô hình Mixture of Experts (MoE) bằng cách di chuyển động các tham số đang hoạt động giữa RAM hệ thống và bộ nhớ GPU.