~/LLAMA CPP/llama-cpp-b11103-adds-dflash-speculative-decoding-support-for-hunyuanocr

llama.cpp b11103 bổ sung hỗ trợ suy luận đoán trước DFlash cho HunyuanOCR

Bản phát hành llama.cpp b11103 bổ sung hỗ trợ layer-input tap cho đồ thị mô hình HunyuanOCR, kích hoạt tính năng suy luận đoán trước (speculative decoding) DFlash cho các mô hình thị giác-ngôn ngữ Hunyuan. Bản nâng cấp cũng khắc phục các lỗi chuyển đổi GGUF liên quan đến xử lý token đặc biệt và tham số cấu hình khi chuyển đổi các mô hình nháp DFlash. Suy luận đoán trước với DFlash giúp đẩy nhanh đáng kể tốc độ suy luận cho các mô hình thị giác-ngôn ngữ như HunyuanOCR mà không làm giảm chất lượng đầu ra. Nhờ sự hỗ trợ gốc trong llama.cpp, các nhà phát triển hiện có thể thực thi các tác vụ OCR tốc độ cao một cách hiệu quả trên phần cứng cục bộ. Thử nghiệm trên Tencent HunyuanOCR 1.5 đạt tỷ lệ chấp nhận nháp khoảng 0,5 và cho ra kết quả OCR chính xác từng byte so với luồng chạy thông thường. Thay đổi này phơi bày các tensor đầu vào tầng (residual stream) mà mô hình nháp DFlash cần để dựng ngữ cảnh chéo mà không làm thay đổi hành vi của hệ thống khi không bật mô hình nháp.

## KIẾN THỨC NỀN

llama.cpp là một khung ứng dụng C/C++ mã nguồn mở giúp suy luận các mô hình ngôn ngữ lớn hiệu quả trên phần cứng cục bộ. Suy luận đoán trước (speculative decoding) là kỹ thuật sử dụng một mô hình nháp nhỏ để dự đoán trước chuỗi token, giúp mô hình mục tiêu xác nhận hàng loạt token song song nhằm giảm độ trễ. DFlash là một kiến trúc mô hình nháp khuếch tán khối (block-diffusion), được tích hợp trong mô hình OCR thị giác-ngôn ngữ HunyuanOCR để gia tăng tốc độ tạo token.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#speculative-decoding#ai-infrastructure

$ subscribe --daily

llama.cpp b11103 bổ sung hỗ trợ suy luận đoán trước DFlash cho HunyuanOCR | Daily News