Bên trong hạ tầng của Poolside AI dùng để huấn luyện mô hình Laguna S 118B
Eiso Kant, đồng giám đốc điều hành của Poolside AI, đã chia sẻ chi tiết về cách một đội ngũ kỹ sư nhỏ xây dựng một "nhà máy mô hình" để huấn luyện Laguna S, một mô hình Mixture of Experts (MoE) với 118 tỷ tham số. Mô hình này được báo cáo là vượt trội hơn mô hình mã nguồn mở Inkling khoảng 1 nghìn tỷ tham số của Thinking Machines. Điều này chứng minh rằng hạ tầng và phương pháp huấn luyện được tối ưu hóa tốt có thể giúp các mô hình nhỏ hơn, chuyên biệt hơn vượt trội so với các mô hình lớn hơn nhiều, giúp giảm rào cản gia nhập trong việc huấn luyện AI tiên tiến. Điều này đặc biệt có ý nghĩa đối với các mô hình lập trình mã nguồn mở, nơi tính hiệu quả và tối ưu chi phí là cực kỳ quan trọng. Mô hình Laguna S sử dụng kiến trúc Mixture of Experts (MoE), cho phép đạt hiệu năng cao trong khi vẫn tiết kiệm tài nguyên tính toán. Đội ngũ kỹ sư tập trung vào việc xây dựng một quy trình "nhà máy mô hình" có khả năng mở rộng để tối ưu hóa quá trình huấn luyện thay vì chỉ đơn thuần tăng quy mô phần cứng thô.
## KIẾN THỨC NỀN
Mixture of Experts (MoE) là một kỹ thuật học máy định tuyến các đầu vào đến các mạng con chuyên biệt (chuyên gia) trong một mô hình lớn hơn, giúp giảm số lượng tham số hoạt động trên mỗi token. Các mô hình mã nguồn mở (open-weight), như các mô hình từ Thinking Machines (Thinky) và Poolside, cho phép các nhà phát triển chạy và tùy chỉnh các hệ thống AI mạnh mẽ ngay tại máy cục bộ hoặc trên hạ tầng riêng của họ.