~/LLM BENCHMAR/a-new-community-svg-generation-prompt-for-benchmarking-local-llms

Thử thách tạo ảnh SVG mới để đánh giá năng lực các mô hình LLM cục bộ

Một người dùng Reddit đã đề xuất một câu lệnh (prompt) đánh giá hiệu năng mới để kiểm tra khả năng lập luận không gian và tạo mã nguồn của các mô hình ngôn ngữ lớn (LLM) bằng cách yêu cầu chúng tạo mã SVG vẽ một con ngựa trên chiếc xe đạp màu xanh trong sa mạc, cùng một con lạc đà ở phía sau. Câu lệnh này đã được sử dụng để so sánh các mô hình như Qwen3.8-27b, Sol 5.6 và Qwen3.6-35B. Mặc dù mang tính chất không chính thức, các câu lệnh do cộng đồng tự phát triển này đóng vai trò như những phép thử thực tế để đánh giá nhanh khả năng xử lý bố cục không gian phức tạp và tạo đồ họa vector của các LLM. Chúng giúp làm nổi bật khoảng cách giữa các mô hình hàng đầu và các mô hình cục bộ đã qua lượng tử hóa trong việc thực thi các chỉ dẫn chứa nhiều đối tượng. Câu lệnh cố tình chứa một lỗi chính tả ("bycicle") để kiểm tra khả năng tự điều chỉnh của mô hình, và quá trình so sánh có sự tham gia của các định dạng lượng tử hóa khác nhau như Unsloth Dynamic (UD-Q4_K_XL). Việc tạo ra mã SVG hợp lệ và có bố cục hình ảnh mạch lạc đòi hỏi mô hình phải có cả kỹ năng lập trình tốt lẫn sự hiểu biết sâu sắc về mối quan hệ không gian.

## KIẾN THỨC NỀN

Việc tạo đồ họa vector SVG là một bài kiểm tra phổ biến đối với các LLM vì nó yêu cầu mô hình phải chuyển đổi mô tả văn bản thành mã nguồn dựa trên tọa độ chính xác. Đánh giá các LLM cục bộ thường liên quan đến việc thử nghiệm các phiên bản lượng tử hóa, chẳng hạn như lượng tử hóa Unsloth Dynamic (UD), giúp tối ưu hóa kích thước mô hình bằng cách gán các mức độ chính xác khác nhau cho các lớp mạng thần kinh khác nhau. Các mô hình tiên phong như Sol 5.6 của OpenAI đại diện cho tiêu chuẩn cao nhất cho các tác vụ lập luận này.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Benchmarks#Local LLMs#SVG Generation#AI Evaluation

$ subscribe --daily

Thử thách tạo ảnh SVG mới để đánh giá năng lực các mô hình LLM cục bộ | Daily News