Anthropic ra mắt Claude Fable 5.1 với bước tiến lớn về suy luận khoa học
Anthropic đã ra mắt Claude Fable 5.1, đạt 52.6% điểm trên benchmark mới Terminal-Bench-Science 0.1, cao gấp đôi so với mức 24.7% của phiên bản Fable 5. Chuyên gia phân tích công nghệ Simon Willison đã đánh giá phiên bản này bằng bài kiểm tra tạo hình chim bồ nông bằng mã SVG trên 5 mức độ suy luận khác nhau của mô hình. Bước nhảy vọt trên các benchmark khoa học cho thấy sự tiến bộ nhanh chóng của AI trong việc xử lý các quy trình nghiên cứu chuyên sâu. Bên cạnh đó, việc kiểm thử các mức độ suy luận mang lại cái nhìn thực tế về cách các mô hình ngôn ngữ lớn tối ưu chi phí tính toán và chất lượng đầu ra cho các tác vụ lập trình sáng tạo. Claude Fable 5.1 cung cấp 5 mức độ suy luận (low, medium, high, xhigh, max) và không có tùy chọn tắt hoàn toàn suy luận. Trong bài thử nghiệm vẽ chim bồ nông bằng mã SVG của Willison, hai thiết lập low và medium cho ra số lượng token gần như tương đương và bỏ qua hoàn toàn các bước suy luận dạng chuỗi.
## KIẾN THỨC NỀN
Bài kiểm tra chim bồ nông của Simon Willison yêu cầu mô hình tạo mã SVG vẽ một con chim bồ nông đi xe đạp nhằm đánh giá định tính khả năng tư duy không gian và lập trình đồ họa. Trong khi đó, Terminal-Bench-Science là bộ công cụ benchmark được xây dựng bởi các chuyên gia để kiểm thử năng lực của đại lý AI trong các quy trình nghiên cứu khoa học chuyên sâu.