IFM Phát Hành K2-Horizon-7B Với Adapter Diffusion Cắm-Và-Chạy Đạt Tốc Độ 5.200 TPS
IFM đã phát hành K2-Horizon-7B, một mô hình ngôn ngữ tự hồi quy 7 tỷ tham số được tích hợp adapter diffusion theo dạng cắm-và-chạy (plug-and-play) song song với các trọng số tự hồi quy. Mô hình này đạt tốc độ suy luận lên tới 5.200 token mỗi giây mà theo tuyên bố là không làm giảm chất lượng đầu ra. Việc đạt được tốc độ lên tới 5.200 token mỗi giây mà không làm suy giảm chất lượng là bước tiến lớn cho các ứng dụng AI thời gian thực và kỹ thuật giải mã không tự hồi quy. Nếu được xác minh rộng rãi, việc kết hợp kiến trúc tự hồi quy với adapter diffusion có thể giảm đáng kể độ trễ suy luận và chi phí vận hành cho các hệ thống năng suất cao. Mô hình gắn một adapter diffusion dạng mô-đun vào các trọng số transformer tự hồi quy tiêu chuẩn, cho phép sinh token song song hoặc tăng tốc thay vì giải mã tuần tự nghiêm ngặt. Các trọng số mô hình hiện đã có trên Hugging Face cùng với thông tin kỹ thuật chi tiết được trình bày trong bài báo arXiv:2609.04010.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn thông thường sinh văn bản theo phương pháp tự hồi quy bằng cách dự đoán từng token một, điều này tạo ra điểm nghẽn về độ trễ trong quá trình suy luận. Nguồn lực ngược lại, các mô hình diffusion sinh đầu ra bằng cách tinh chỉnh nhiễu thành dữ liệu có cấu trúc qua nhiều bước, cho phép sinh song song diện rộng hơn. Các adapter cắm-và-chạy cho phép các nhà phát triển bổ sung tính năng mô-đun vào các mô hình nền tảng hiện có mà không cần huấn luyện lại toàn bộ tham số cốt lõi từ đầu.