~/LLM BENCHMAR/90-run-benchmark-compares-thinkingcap-fable-fusion-and-stock-qwen3-6-27b

Thử nghiệm 90 lượt so sánh ThinkingCap, Fable Fusion và Qwen3.6-27B gốc

Một thử nghiệm hệ thống gồm 90 lượt chạy đã đánh giá ThinkingCap, Fable Fusion và Qwen3.6-27B gốc trên các tác vụ tự trị (agentic) bằng cách sử dụng các không gian làm việc Kubernetes độc lập và hệ thống giám sát OpenTelemetry. Kết quả cho thấy mặc dù ThinkingCap giảm 34% lượng token suy nghĩ và hoàn thành nhanh nhất trong hầu hết các tác vụ, mô hình Qwen gốc vẫn là phiên bản kỷ luật và đáng tin cậy nhất. So sánh thực nghiệm này nhấn mạnh rằng các biến thể LLM được tinh chỉnh (fine-tune) cho việc suy nghĩ không phải lúc nào cũng vượt trội hơn mô hình gốc trong các quy trình làm việc tự trị. Nó cung cấp dữ liệu cụ thể cho thấy việc tiết kiệm token suy nghĩ có thể phải đánh đổi bằng sự suy giảm về độ tin cậy và tính nhất quán. Hiệu suất của ThinkingCap có tính lưỡng cực (bimodal), tạo ra cả những lượt chạy tiết kiệm nhất lẫn những thất bại tốn kém nhất do đuổi theo các lỗi ảo, trong khi Fable Fusion tỏ ra là một người điều tra xuất sắc nhưng dễ bị ảo tưởng thông tin. Thử nghiệm đã sử dụng llama.cpp thông qua llama-swap trên một GPU RTX 5090 duy nhất với cửa sổ ngữ cảnh 131k.

## KIẾN THỨC NỀN

Quy trình làm việc tự trị (agentic workflows) liên quan đến việc các LLM hoạt động như các tác nhân tự chủ có thể sử dụng công cụ, gọi API và thực thi mã để giải quyết các tác vụ phức tạp. Qwen3.6-27B là một mô hình ngôn ngữ mã nguồn mở mạnh mẽ, trong khi ThinkingCap và Fable Fusion là các bản tinh chỉnh hoặc cấu hình chuyên biệt được thiết kế để tối ưu hóa khả năng suy luận và sử dụng công cụ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Benchmarking#Agentic AI#Local LLMs#Qwen#Performance Evaluation

$ subscribe --daily

Thử nghiệm 90 lượt so sánh ThinkingCap, Fable Fusion và Qwen3.6-27B gốc | Daily News