~/AI/simon-willison-tests-frontier-llms-with-an-absurd-svg-generation-prompt

Simon Willison thử nghiệm các mô hình LLM hàng đầu với yêu cầu tạo SVG kỳ quặc

Simon Willison đã thực hiện một thử nghiệm vui khi yêu cầu các mô hình AI hàng đầu—bao gồm Mistral Large 4, Claude Opus 5.5, GPT-6.1 Sol và Gemini 3.8 Flash—tạo mã SVG cho hình ảnh 'một con tatus mặc quần tất lưới đang sang đường trái phép trên Sao Hỏa'. Thử nghiệm này được truyền cảm hứng trực tiếp từ một bình luận hài hước trên Hacker News về tình trạng bão hòa điểm chuẩn AI. Khi các điểm chuẩn AI tiêu chuẩn gặp hiện tượng bão hòa, những câu lệnh hình ảnh mới lạ và vô cùng cụ thể sẽ cung cấp một cách không chính thức để đánh giá khả năng suy luận và tổng hợp không gian thực sự của mô hình mà không lo bị trùng lặp dữ liệu huấn luyện. Thử nghiệm này làm nổi bật cách các mô hình LLM hàng đầu xử lý việc tạo mã XML phức tạp cho những yêu cầu mang tính siêu thực. Willison đã thực hiện thử nghiệm bằng công cụ dòng lệnh mã nguồn mở `llm` trên các mô hình ở mức độ suy luận mặc định. Kết quả đầu ra là mã SVG được hiển thị và so sánh bằng một công cụ xem SVG Markdown trực tuyến do ông tự phát triển.

## KIẾN THỨC NỀN

Hiện tượng bão hòa điểm chuẩn AI xảy ra khi các thước đo đánh giá tiêu chuẩn mất đi hiệu quả do các mô hình hàng đầu đạt điểm số gần như tuyệt đối hoặc đã nạp các bộ dữ liệu kiểm tra vào dữ liệu huấn luyện. Việc tạo đồ họa vector SVG (Scalable Vector Graphics) thường được dùng làm bài thử nghiệm ngẫu hứng cho các mô hình ngôn ngữ, đòi hỏi LLM phải xuất mã XML có cấu trúc để hiển thị các hình ảnh trực quan hợp lý mà không có phản hồi hình ảnh theo thời gian thực.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI#LLM#Benchmarks#Mistral#Generative AI

$ subscribe --daily

Simon Willison thử nghiệm các mô hình LLM hàng đầu với yêu cầu tạo SVG kỳ quặc | Daily News