Đánh Giá Năng Lực GPT-6 Astra Qua Benchmark Trực Quan Vẽ Bồ Nông SVG
Simon Willison đã thử nghiệm mô hình GPT-6 Astra mới trên các mức độ suy luận (reasoning effort) khác nhau với câu lệnh tạo SVG 'bồ nông đi xe đạp' và so sánh với các biến thể GPT-5.6. Kết quả cho thấy Astra tạo ra đồ họa vectơ chất lượng hơn hẳn các mô hình trước, ngay cả ở mức suy luận thấp nhất của Astra cũng vượt trội hơn GPT-5.6 Sol ở mức suy luận tối đa. Đánh giá này cho thấy các kiến trúc mô hình thế hệ mới có thể mang lại khả năng suy luận không gian và tổng hợp mã nguồn vượt trội trong khi tiêu thụ ít token hơn, giúp chi phí thực tế cạnh tranh dù đơn giá token cao hơn. Nó mang lại góc nhìn thực tế trong việc cân bằng giữa lựa chọn mô hình, tham số mức độ suy luận và chi phí API cho các tác vụ tạo mã đồ họa. Dù Astra có đơn giá cao gấp đôi GPT-5.6 Sol ($10/$50 trên mỗi triệu token so với $5/$30), lượng token đầu ra ít hơn khiến tổng chi phí chạy tác vụ rất tối ưu, chẳng hạn như tạo SVG chất lượng ở mức suy luận 'low' chỉ tốn 9,55 cent. Tuy nhiên, Astra không hỗ trợ tắt hoàn toàn suy luận (`reasoning=none`) và vẫn gặp khó khăn trong việc vẽ chính xác các chi tiết giải phẫu như chân bồ nông nằm ở hai bên khung xe ngoại trừ ở mức suy luận tối đa.
## KIẾN THỨC NỀN
'Pelican Bicycle Benchmark' là bài kiểm tra LLM phi chính thức do Simon Willison tạo ra năm 2024 nhằm thử nghiệm khả năng viết mã Scalable Vector Graphics (SVG) mô tả một hình ảnh phức tạp. Việc tạo mã SVG đòi hỏi mô hình ngôn ngữ lớn phải thực hiện suy luận không gian mà không có phản hồi thị giác trực tiếp. Bên cạnh đó, tham số mức độ suy luận (reasoning effort) cho phép điều chỉnh số lượng token suy luận nội bộ mà mô hình xử lý trước khi đưa ra kết quả cuối cùng.