Phát Hành Các Biến Thể Mô Hình Ornith-1.5 Kết Hợp Mô Hình Nháp DFlash Trên Hugging Face
Các kho lưu trữ mới trên Hugging Face đã phát hành những biến thể của mô hình Ornith-1.5 (bao gồm các phiên bản 9B, 35B-A3B và 397B) được ghép cặp với mô hình nháp DFlash. Các bản phát hành này giúp kích hoạt kỹ thuật giải mã suy đoán nhằm tăng tốc suy luận LLM cục bộ. Giải mã suy đoán giúp giảm đáng kể độ trễ sinh token mà không làm thay đổi chất lượng đầu ra của mô hình chính. Việc cung cấp sẵn các mô hình nháp DFlash cho các phiên bản Ornith-1.5 lên đến 397B tham số giúp cộng đồng dễ dàng tăng tốc suy luận cục bộ cho các mô hình mở quy mô lớn. DFlash sử dụng kiến trúc khuếch tán khối để tạo song song nhiều token nháp trong một lượt lan truyền tiến duy nhất, thay vì tạo tuần tự tự hồi quy. Kiến trúc này cũng tái sử dụng trạng thái ẩn ngữ cảnh từ mô hình đích thông qua cơ chế tiêm KV, giúp tránh các phép tính dư thừa trong bước tạo bản nháp.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn thường sinh văn bản theo cơ chế tự hồi quy, dự đoán từng token một ở mỗi bước, khiến khả năng tính toán song song của phần cứng chưa được khai thác tối đa. Giải mã suy đoán (speculative decoding) tăng tốc suy luận bằng cách dùng một mô hình nháp nhanh để đề xuất các token ứng viên, sau đó mô hình đích lớn hơn sẽ xác thực chúng một cách song song. DFlash là một khung làm việc thay thế các mô hình nháp tuần tự thông thường bằng mô hình khuếch tán khối song song siêu nhẹ.