~/BYTEDANCE/bytedance-reportedly-planning-to-train-a-5-trillion-parameter-ai-model

ByteDance Được Cho Là Đang Lên Kế Hoạch Huấn Luyện Mô Hình AI Hơn 5 Nghìn Tỷ Tham Số

Nhóm Seed Foundation của ByteDance được cho là đang thảo luận về kế hoạch huấn luyện một mô hình AI khổng lồ với hơn 5 nghìn tỷ tham số, đưa nó trở thành mô hình lớn nhất từng được biết đến tại Trung Quốc. Dự án này được dẫn dắt bởi Xiang Liang và Shen Ke, hai nhân sự cốt cán trong hệ thống phát triển mô hình lớn và AI của ByteDance. Bước đi này thể hiện sự leo thang mạnh mẽ trong cuộc đua AI tại Trung Quốc, nhằm vượt mặt các đối thủ như Alibaba và Moonshot AI bằng cách đẩy giới hạn quy mô mô hình lên cực đại. Người sáng lập ByteDance, Zhang Yiming, đã bày tỏ sự ủng hộ chiến lược cho nỗ lực này, nhấn mạnh việc theo đuổi giới hạn trí tuệ thay vì các lợi ích ngắn hạn từ việc chưng cất mô hình (distillation). Một số nhân sự nội bộ coi việc nhảy vọt về quy mô này là một canh bạc, nhưng Zhang Yiming đã trấn an đội ngũ và chấp nhận việc tạm thời tụt hậu để tập trung vào các đột phá dài hạn. Ông đặc biệt nhấn mạnh lập trình là hướng đi cốt lõi và bày tỏ sự phản đối đối với phương pháp chưng cất tri thức (knowledge distillation), cho rằng nó chỉ sao chép lại các mô hình hiện có như Claude.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn dựa vào các tham số—các biến số mà mô hình học được trong quá trình huấn luyện—để xử lý và tạo văn bản, trong đó số lượng tham số lớn hơn thường đi kèm với mức độ thông minh cao hơn. Chưng cất tri thức (knowledge distillation) là kỹ thuật huấn luyện một mô hình "học sinh" nhỏ hơn, hiệu quả hơn để tái tạo hành vi của mô hình "giáo viên" lớn hơn, giúp tăng tốc độ triển khai nhưng có thể hạn chế khả năng tự phát triển độc lập.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#ByteDance#Large Language Models#AI Training#Artificial Intelligence#China Tech

$ subscribe --daily

ByteDance Được Cho Là Đang Lên Kế Hoạch Huấn Luyện Mô Hình AI Hơn 5 Nghìn Tỷ Tham Số | Daily News