~/LLM/lm-eval-ledger-an-open-source-tool-for-visually-inspecting-llm-benchmark

lm-eval-ledger: Công cụ mã nguồn mở giúp kiểm tra trực quan kết quả đánh giá LLM

Lập trình viên jayminbhan đã phát hành lm-eval-ledger, một bộ công cụ đánh giá và ứng dụng web mã nguồn mở cho các mô hình ngôn ngữ lớn (LLM). Công cụ này tự động lưu dữ liệu tạo văn bản vào cơ sở dữ liệu SQLite cục bộ và cung cấp giao diện web Flask để kiểm tra, so sánh câu trả lời của mô hình theo từng câu hỏi. Các bộ công cụ đánh giá tiêu chuẩn thường chỉ cung cấp chỉ số tổng quan hoặc tệp dữ liệu thô như JSONL/Parquet, buộc nhà phát triển phải tự viết kịch bản để phân tích lỗi. lm-eval-ledger giúp đơn giản hóa quá trình sửa lỗi mô hình bằng cách cung cấp tính năng so sánh song song, kiểm tra câu lệnh, đáp án trích xuất và thống kê hiệu suất ngay trên giao diện web. Công cụ sử dụng tệp cấu hình YAML để chạy đánh giá nhiều mô hình và tác vụ chỉ qua một dòng lệnh CLI. Nó hỗ trợ các backend như vLLM, SGLang, Hugging Face transformers và llama.cpp trên Linux lẫn Windows, đồng thời ghi lại các chỉ số như tốc độ sinh token (tok/s), số lượng ký tự và lý do dừng sinh văn bản.

## KIẾN THỨC NỀN

Đánh giá LLM bao gồm việc chạy các bộ kiểm thử chuẩn như GSM8K để đo lường khả năng trên nhiều tác vụ khác nhau. Các bộ công cụ như lm-evaluation-harness của EleutherAI hỗ trợ quá trình này, nhưng việc kiểm tra dữ liệu thô ở dạng tệp Parquet thường gây khó khăn khi cần chẩn đoán nguyên nhân mô hình đưa ra kết quả sai.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Benchmarking#Developer Tools#AI Evaluation#Open Source

$ subscribe --daily

lm-eval-ledger: Công cụ mã nguồn mở giúp kiểm tra trực quan kết quả đánh giá LLM | Daily News