~/LLAMA CPP/llama-cpp-b10273-release-fixes-sampler-initialization-in-backend-sampling

Bản phát hành llama.cpp b10273 khắc phục lỗi khởi tạo bộ lấy mẫu trong backend-sampling

Bản phát hành llama.cpp b10273 loại bỏ "full-context windows" (cửa sổ ngữ cảnh đầy đủ) khỏi các bộ lấy mẫu dựa trên lịch sử (history-based samplers) để giải quyết các vấn đề về thứ tự khởi tạo. Thay vì phân giải giá trị -1 thành toàn bộ chiều dài ngữ cảnh, giá trị này hiện được phân giải thành 1024, và các bộ lấy mẫu dựa trên lịch sử sẽ chia sẻ giá trị mặc định là 64. Bản phát hành này giải quyết xung đột khởi tạo nghiêm trọng do tính năng backend-sampling gây ra, khi các bộ lấy mẫu được xây dựng trước khi toàn bộ ngữ cảnh llama được thiết lập. Việc khắc phục lỗi này giúp quá trình thực thi mượt mà hơn và ngăn ngừa lỗi sập hoặc hành vi không chính xác khi chạy suy luận với tính năng lấy mẫu tăng tốc phần cứng. Thay đổi này loại bỏ tham số `context_size` khỏi các bộ lấy mẫu dựa trên lịch sử vì hệ thống không thể suy ra chiều dài ngữ cảnh cuối cùng tại thời điểm xây dựng bộ lấy mẫu. Bản phát hành phụ này cũng bao gồm các tệp nhị phân được biên dịch sẵn cho nhiều nền tảng, mặc dù hỗ trợ KleidiAI cho macOS Apple Silicon vẫn bị vô hiệu hóa.

## KIẾN THỨC NỀN

Trong suy luận LLM, các bộ lấy mẫu (samplers) quyết định cách mô hình chọn token tiếp theo từ các phân phối xác suất. Tính năng "backend-sampling" trong llama.cpp tích hợp trực tiếp bước lấy mẫu này vào đồ thị tính toán trên các backend như CUDA để giảm chi phí truyền dữ liệu giữa CPU và GPU, nhưng điều này yêu cầu phải khởi tạo các bộ lấy mẫu trước khi đối tượng ngữ cảnh (context object) hoàn chỉnh được tạo ra đầy đủ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#LLM Inference#Open Source#AI Infrastructure

$ subscribe --daily

Bản phát hành llama.cpp b10273 khắc phục lỗi khởi tạo bộ lấy mẫu trong backend-sampling | Daily News