~/AI ML/open-source-models-laguna-s2-1-and-kimi-k3-push-the-performance

Các mô hình nguồn mở Laguna S2.1 và Kimi K3 thúc đẩy giới hạn Pareto về hiệu năng và chi phí

Các bản phát hành mô hình AI trọng số mở gần đây, bao gồm Laguna S2.1 của Poolside và Kimi K3 của Moonshot AI, chứng minh rằng các mô hình nguồn mở đang ngày càng cạnh tranh mạnh mẽ. Laguna S2.1 là mô hình tác nhân lập trình chuyên biệt với 8B tham số hoạt động, trong khi Kimi K3 là mô hình suy luận đa phương thức khổng lồ với 2,8T tham số. Các bản phát hành này cho thấy khả năng huấn luyện các mô hình tiên tiến đang được dân chủ hóa, cho phép các giải pháp thay thế nguồn mở thách thức các mô hình độc quyền trên giới hạn Pareto về hiệu năng và chi phí. Điều này giúp các nhà phát triển tiếp cận các mô hình chuyên biệt, có năng lực cao mà không cần phụ thuộc hoàn toàn vào các API đóng. Laguna S2.1 sử dụng kiến trúc Hỗn hợp chuyên gia (MoE) với tổng cộng 118B tham số (8B tham số hoạt động) và hỗ trợ cửa sổ ngữ cảnh 1M token cùng khả năng tư duy. Kimi K3 sở hữu kiến trúc MoE 2,8T tham số được xây dựng trên Kimi Delta Attention và Attention Residuals, cung cấp khả năng thị giác bản địa và quy trình làm việc của tác nhân dài hạn.

## KIẾN THỨC NỀN

Giới hạn Pareto trong học máy đại diện cho sự đánh đổi tối ưu giữa các mục tiêu mâu thuẫn nhau, chẳng hạn như hiệu năng của mô hình so với chi phí tính toán hoặc kích thước tham số. Hỗn hợp chuyên gia (MoE) là một kiến trúc mạng thần kinh chỉ kích hoạt một tập hợp con các tham số (tham số hoạt động) cho mỗi đầu vào, giúp giảm đáng kể chi phí suy luận trong khi vẫn duy trì năng lực của một mô hình lớn hơn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#Open Source AI#Large Language Models#Model Evaluation

$ subscribe --daily

Các mô hình nguồn mở Laguna S2.1 và Kimi K3 thúc đẩy giới hạn Pareto về hiệu năng và chi phí | Daily News