~/LLM/reddit-audit-exposes-discrepancies-in-ternary-bonsai-2-benchmark-claims

Phân tích trên Reddit vạch trần sai lệch trong tuyên bố benchmark của Ternary Bonsai 2

Một phân tích từ cộng đồng đã tiết lộ rằng mặc dù Bonsai quảng cáo tuyên bố duy trì 98.2% hiệu suất trí tuệ cho Ternary Bonsai 2 27B, tài liệu whitepaper của họ lại cho thấy mô hình chỉ giữ được khoảng 75% hiệu suất trên các benchmark lập trình chính. Cụ thể, mô hình đạt 52.8 điểm trên Terminal-Bench 2.1 và 60.8 điểm trên SWE-bench Verified, giảm đáng kể từ mức 69.7 và 80.6 của mô hình gốc. Cuộc kiểm tra này nhấn mạnh sự hoài nghi ngày càng tăng đối với các chỉ số tiếp thị của mô hình ngôn ngữ được lượng hóa, đồng thời đề cao tầm quan trọng của việc đánh giá độc lập. Khi các kỹ thuật lượng hóa ít bit ngày càng phổ biến, các tuyên bố thiếu chính xác có thể khiến các nhà phát triển hiểu sai về năng lực thực tế trong lập trình và làm việc dạng agent. Các tài liệu đính kèm cho thấy Ternary Bonsai 2 27B chỉ duy trì khoảng 3/4 hiệu suất của mô hình gốc trên các tác vụ kỹ thuật phần mềm phức tạp, khác với mức giữ lại gần như trọn vẹn như đã quảng cáo. Sự sai lệch này phản ánh việc tiếp thị tiêu đề ưu tiên các benchmark có kết quả cao trong khi giấu các điểm số kém hơn ở sâu bên trong báo cáo kỹ thuật.

## KIẾN THỨC NỀN

Lượng hóa (Quantization) là kỹ thuật nén các mô hình ngôn ngữ lớn bằng cách chuyển đổi trọng số độ chính xác cao sang định dạng ít bit hơn, chẳng hạn như dạng ternary chỉ dùng các trọng số {-1, 0, +1}, nhằm giảm đáng kể bộ nhớ tiêu thụ. SWE-bench Verified đánh giá mô hình AI dựa trên khả năng giải quyết các sự cố mã nguồn thực tế trên GitHub, trong khi Terminal-Bench đo lường năng lực thực thi các tác vụ kỹ thuật phức tạp của AI agent trong môi trường dòng lệnh (terminal).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llm#benchmarking#quantization#ai-evaluation#localllama

$ subscribe --daily

Phân tích trên Reddit vạch trần sai lệch trong tuyên bố benchmark của Ternary Bonsai 2 | Daily News