01Công bố điểm số Terminal Bench v4 so sánh năng lực thực thi dòng lệnh của các LLMREDDIT · /u/Ok_Warning2146 · reddit.com · 10:19 11 thg 913h
02Bài viết cộng đồng bảo vệ phương pháp và tính độc lập của nền tảng đánh giá Artificial AnalysisREDDIT · /u/Antblue · reddit.com · 22:26 10 thg 91d
03Dư luận nghi vấn việc Artificial Analysis liên tục thay đổi phương pháp đánh giá LLMREDDIT · /u/Altruistic_Plate1090 · reddit.com · 18:01 10 thg 91d
04So sánh hiệu năng thực tế: DeepSeek-V4-Flash-Vision với Qwen3.8-Flash-NextREDDIT · /u/pabloodiablo · reddit.com · 20:15 06 thg 95d
05Chỉ số mới so sánh hiệu quả lập trình của LLM: Mật độ Trí tuệREDDIT · /u/Informal-Trouble2183 · reddit.com · 22:20 30 thg 812d
06Terminal Bench 4.0 Ra Mắt: GLM-5.3 Đạt Hiệu Năng Ngang Ngửa Fable 5REDDIT · /u/SorosAhaverom · reddit.com · 07:17 29 thg 813d
07Chỉ trích về "Chỉ số Trí tuệ" của Artificial Analysis gây tranh cãi về benchmark LLMREDDIT · /u/chocolateUI · reddit.com · 09:43 22 thg 820d
08Nhà phát triển báo cáo điểm số 96% nghi vấn của Ox Alpha trên SWE-bench Verified MiniREDDIT · /u/No_Tip9917 · reddit.com · 16:00 21 thg 821d
09Thử thách tạo ảnh SVG mới để đánh giá năng lực các mô hình LLM cục bộREDDIT · /u/sterby92 · reddit.com · 10:11 20 thg 822d
10Thử nghiệm hiệu năng cục bộ so sánh Muse Glimmer 30B, Qwen 3.6 27B và Gemma 4 31BREDDIT · /u/WonderRico · reddit.com · 20:10 11 thg 831d
11Lập trình viên so sánh hiệu năng lập trình của hai LLM cục bộ Muse Glimmer và Qwen 27BREDDIT · /u/PathfinderTactician · reddit.com · 10:27 11 thg 831d
12Muse Glimmer lọt top 97 bảng xếp hạng Text Arena toàn cầuTWITTER · arena · x.com · 00:54 11 thg 831d
13Thử nghiệm độc lập tái hiện điểm số 82,7% của DeepSeek V4 Flash trên Terminal-Bench 2.1REDDIT · /u/Exciting-Camera3226 · reddit.com · 08:39 09 thg 833d
14Người dùng Reddit cáo buộc Artificial Analysis thao túng trọng số bảng xếp hạng LLMREDDIT · /u/Infinite-Local5435 · reddit.com · 03:06 07 thg 835d
15Nghi vấn về sự khác biệt giữa bảng xếp hạng benchmark LLM và hiệu suất lập trình thực tếREDDIT · /u/Informal-Trouble2183 · reddit.com · 13:21 06 thg 836d
16DeepSeek v4 Flash Vượt Trội Về Tốc Độ và Chi Phí Trong Các Tác Vụ AgenticREDDIT · /u/LimpComedian1317 · reddit.com · 19:30 03 thg 839d
17Nhu cầu về các bộ đánh giá LLM đa dạng ngoài lập trìnhREDDIT · /u/Dance-Till-Night1 · reddit.com · 00:08 02 thg 840d
18Bảng xếp hạng Chatbot Arena của các mô hình GPT-5.6 Sol, Terra và Luna từ OpenAITWITTER · arena · x.com · 18:49 31 thg 742d
19Tranh luận về việc các benchmark LLM không phản ánh đúng khả năng sử dụng thực tếREDDIT · /u/MaxDev0 · reddit.com · 02:18 31 thg 742d
20Kiểm tra các Benchmark LLM lớn phát hiện tới 12% câu hỏi bị lỗiREDDIT · /u/pawofdoom · reddit.com · 19:58 28 thg 745d