01Đánh giá các mô hình ngôn ngữ lớn qua bài kiểm tra La bàn Chính trịREDDIT · /u/Thrumpwart · reddit.com · 14:30 29 thg 87d
02Chuẩn hóa tính tái lập cho bảng đánh giá tỷ lệ từ chối của LLM trên Model CardREDDIT · /u/Dabber43 · reddit.com · 12:07 18 thg 818d
03Người dùng báo cáo hiệu suất kém của Muse Glimmer từ Meta trong thử nghiệm lập trìnhREDDIT · /u/BarberIcy366 · reddit.com · 19:02 10 thg 826d
04Công cụ tương tác so sánh 1.109 kết quả đầu ra từ 33 mô hình Qwen AIREDDIT · /u/kms_dev · reddit.com · 16:57 02 thg 834d
05Bộ sưu tập các benchmark nhỏ theo từng lĩnh vực dành cho LLM chạy localREDDIT · /u/EmilPi · reddit.com · 21:20 01 thg 834d
06Nhu cầu về các bài đánh giá LLM dựa trên gỡ lỗi đa bước và lập trình dạng tác nhânREDDIT · /u/vasimv · reddit.com · 15:07 01 thg 835d
07Simon Willison Ra Mắt `smevals`, Bộ Công Cụ Đánh Giá LLM Gọn NhẹRSS · Simon Willison · simonwillison.net · 21:15 31 thg 735d
08Vấn đề của các câu lệnh chung chung trong đánh giá mô hình AIREDDIT · /u/ddeeppiixx · reddit.com · 09:29 31 thg 736d
09Điểm số AutoEval của mô hình Inkling-Small được công bố trên Text ArenaTWITTER · arena · x.com · 18:04 30 thg 737d
10Inkling-Small Ra Mắt Ở Vị Trí Thứ 88 Trên Bảng Xếp Hạng LMSYS Text ArenaTWITTER · arena · x.com · 18:04 30 thg 737d
11LMSYS Chatbot Arena Công Bố Phương Pháp Tính Điểm AutoEval MớiTWITTER · arena · x.com · 18:04 30 thg 737d
12Arena Ra Mắt AutoEval Để Xếp Hạng LLM Bằng Mô Hình Phần ThưởngTWITTER · arena · x.com · 17:18 30 thg 737d
13Chatbot Arena ra mắt bảng xếp hạng Độ xác thực với Claude Opus 5 dẫn đầuTWITTER · arena · x.com · 19:56 27 thg 739d
14Đánh giá Laguna-S-2.1: Tốc độ và gọi công cụ vượt trội nhưng dễ bị ảo tưởngREDDIT · /u/klinec · reddit.com · 20:29 21 thg 745d