Nhà nghiên cứu từ Hugging Face chia sẻ bài thuyết trình tổng quan về hệ sinh thái AI cục bộ
Merve từ Hugging Face đã chia sẻ bộ slide thuyết trình từ một hội nghị dành cho nhà phát triển, giới thiệu về llama.cpp và các khái niệm cơ bản trong suy luận AI cục bộ. Bài thuyết trình đóng vai trò như một tài liệu giáo dục về các chủ đề cốt lõi như tối ưu hóa bộ nhớ, suy luận đoán nhận (speculative decoding) và sự khác biệt giữa giai đoạn prefill và decode. Khi việc chạy LLM trên thiết bị cục bộ ngày càng phổ biến, các tài liệu giáo dục bài bản từ chuyên gia giúp nhà phát triển hiểu rõ hơn về phần cứng cấp thấp và đánh đổi về hiệu năng. Việc nắm vững những nền tảng này giúp các kỹ sư tối ưu hóa tốc độ suy luận mô hình và hiệu quả sử dụng tài nguyên trên phần cứng cá nhân. Bộ slide đề cập tới các công cụ thực tế như llama.cpp cùng với cách phân bổ bộ nhớ phần cứng và các giai đoạn thực thi. Tài liệu giải thích cách nghẽn băng thông bộ nhớ ảnh hưởng đến quá trình sinh token tự hồi quy và cách các kỹ thuật như speculative decoding giúp giảm độ trễ.
## KIẾN THỨC NỀN
Quá trình suy luận LLM hiện đại được chia thành hai giai đoạn chính: prefill (xử lý song song câu lệnh đầu vào để tạo KV cache) và decode (sinh từng token đầu ra một cách nối tiếp). Vì giai đoạn decode bị giới hạn nhiều bởi băng thông bộ nhớ, kỹ thuật speculative decoding giúp tăng tốc bằng cách sử dụng một mô hình nháp nhỏ hơn để đề xuất nhiều token cùng lúc trước khi mô hình lớn hơn xác minh chúng một cách song song.