~/LARGE LANGUA/dloop-introduces-looped-speculative-decoding-to-accelerate-llm-inference

DLoop Giới Thiệu Speculative Decoding Dạng Lặp Giúp Tăng Tốc Suy Luận LLM

Các nhà nghiên cứu từ NAVER AI đã giới thiệu DLoop, một khung làm việc speculative decoding dạng lặp thực hiện nhiều vòng tạo bản nháp linh hoạt trước khi kích hoạt bước kiểm định của mô hình đích. Bằng cách tiếp tục tạo bản nháp khi mô hình nhỏ vẫn giữ độ tự tin cao, DLoop giảm đáng kể số lượt lan truyền tiến không cần thiết trên mô hình đích trong quá trình sinh văn bản của LLM. Phương pháp này giải quyết nút thắt cổ chai lớn trong speculative decoding khi mô hình đích phải kiểm định token nháp quá thường xuyên ngay cả khi mô hình nháp có độ chính xác cao. Trên nhiều kỹ thuật giải mã như EAGLE-3 và Domino, DLoop mang lại mức tăng tốc thời gian thực từ 5% đến 41% mà vẫn đảm bảo giữ nguyên 100% chất lượng đầu ra. Để duy trì độ chính xác cao khi tạo bản nháp qua nhiều vòng chưa kiểm định, DLoop sử dụng phương pháp huấn luyện nhận biết vòng lặp (loop-aware training) giúp mô hình nháp làm quen với các trạng thái ẩn của chính nó từ các bước trước. Kỹ thuật này tương thích với cả mô hình nháp tự hồi quy lẫn song song, bao gồm các mô-đun dự đoán đa token và những phương pháp như DFlash hay DSpark.

## KIẾN THỨC NỀN

Quá trình suy luận của Mô hình Ngôn ngữ Lớn (LLM) thường bị giới hạn bởi băng thông bộ nhớ do cơ chế sinh tự hồi quy từng token một. Speculative decoding khắc phục điều này bằng cách sử dụng một mô hình nháp nhẹ để nhanh chóng đề xuất một chuỗi token, sau đó mô hình đích lớn hơn sẽ kiểm định tất cả cùng lúc trong một bước song song.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Large Language Models#Speculative Decoding#Inference Optimization#Machine Learning Research#AI Acceleration

$ subscribe --daily

DLoop Giới Thiệu Speculative Decoding Dạng Lặp Giúp Tăng Tốc Suy Luận LLM | Daily News