~/LLM/ant-group-launches-ling-3-0-flash-hybrid-reasoning-model-with-124b

Ant Group ra mắt mô hình suy luận hỗn hợp Ling-3.0-flash với 124 tỷ tham số

Ant Group đã ra mắt Ling-3.0-flash, một mô hình suy luận hỗn hợp nguyên bản với tổng số 124 tỷ tham số và chỉ 5,1 tỷ tham số kích hoạt. Mặc dù có kích thước nhỏ hơn, mô hình này vẫn đạt hiệu năng tương đương hoặc vượt trội so với mô hình cờ đầu thế hệ trước có quy mô 1T tham số là Ring-2.6-1T. Sự kiện này thể hiện bước nhảy vọt về hiệu suất của các mô hình ngôn ngữ lớn (LLM), chứng minh rằng kiến trúc MoE thưa và chú ý hỗn hợp có thể mang lại hiệu năng cấp cờ đầu với chi phí tính toán cực thấp. Điều này giúp giảm rào cản trong việc triển khai các quy trình AI Agent phức tạp, nhanh chóng và tiết kiệm chi phí trong môi trường sản xuất thực tế. Mô hình sử dụng kiến trúc chú ý tuyến tính hỗn hợp xếp chồng Kimi Delta Attention (KDA) và Multi-head Latent Attention (MLA), kết hợp với cấu trúc Mixture of Experts (MoE) thưa tỷ lệ 1/64. Ngoài ra, nó tích hợp hệ thống lưu trữ đệm phân cấp SGLang HiCache và Mooncake, giúp giảm thời gian phản hồi ký tự đầu tiên (TTFT) từ 60% đến hơn 80% đối với các tương tác ngữ cảnh dài.

## KIẾN THỨC NỀN

Các mô hình Transformer truyền thống thường gặp khó khăn về độ phức tạp tính toán khi xử lý các chuỗi dài do cơ chế chú ý tiêu chuẩn tăng theo hàm mũ bậc hai. Để giải quyết vấn đề này, các cơ chế chú ý tuyến tính như Kimi Delta Attention (KDA) được thiết kế để cải thiện hiệu suất phần cứng. Thêm vào đó, các hệ thống lưu trữ đệm KV phân tán như Mooncake và SGLang HiCache giúp tối ưu hóa quá trình suy luận bằng cách lưu trữ và chia sẻ dữ liệu ngữ cảnh đã tính toán trước đó, tránh tính toán lặp lại và tăng tốc thời gian phản hồi.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Model Architecture#Mixture of Experts#Ant Group#AI Agents

$ subscribe --daily

Ant Group ra mắt mô hình suy luận hỗn hợp Ling-3.0-flash với 124 tỷ tham số | Daily News