~/LLM AGENTS/open-source-trueforge-agent-harness-matches-claude-managed-agents-performance-at-lower

Khung TrueForge Mã Nguồn Mở Đạt Hiệu Năng Ngang Claude Managed Agents Với Chi Phí Thấp Hơn

Các nhà phát triển của khung phần mềm agent mã nguồn mở TrueForge đã đánh giá hiệu năng bộ công cụ của họ so với Claude Managed Agents trên bộ dữ liệu DevRev Enterprise-Bench. Khi chạy cùng mô hình Opus 4.8, TrueForge đạt cùng tỷ lệ hoàn thành 11/14 tác vụ nhưng tiêu thụ ít hơn 63% lượng token và giảm 30% chi phí mỗi lượt chạy. Kết quả thử nghiệm cho thấy việc tối ưu hóa khung phần mềm agent—thông qua nén ngữ cảnh và tối ưu vòng lặp công cụ—có thể giảm đáng kể lượng token tiêu thụ mà không làm giảm độ chính xác. Hơn nữa, việc duy trì một khung không phụ thuộc mô hình cho phép nhà phát triển chuyển sang mô hình khác như GLM-5.2 để đạt hiệu năng tương đương với chi phí thấp hơn tới 75%. TrueForge đã giảm số lần gọi công cụ trung bình từ 32 xuống 19 lượt cho mỗi tác vụ bằng cách loại bỏ các đầu ra dung lượng lớn khỏi ngữ cảnh LLM và nén lượt thoại. Được phát hành theo giấy phép MIT, TrueForge hỗ trợ các điểm cuối tương thích OpenAI, tích hợp công cụ/MCP và các phiên duy trì, mặc dù hiện chưa có sẵn công cụ giám sát (tracing) và môi trường thực thi mã.

## KIẾN THỨC NỀN

Khung phần mềm agent (agent harness hay agent scaffolding) là hạ tầng phần mềm bao quanh Mô hình Ngôn ngữ Lớn để quản lý việc thực thi công cụ, trạng thái hội thoại, bộ nhớ và các vòng lặp phản hồi. Claude Managed Agents là dịch vụ đám mây của Anthropic được thiết kế để lưu trữ và quản lý vận hành agent ở quy mô lớn, trong khi DevRev Enterprise-Bench là bộ thử nghiệm mở nhằm đo lường hiệu năng của agent AI trên các tác vụ doanh nghiệp thực tế.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Agents#Open Source#AI Engineering#Benchmarking#Cost Optimization

$ subscribe --daily

Khung TrueForge Mã Nguồn Mở Đạt Hiệu Năng Ngang Claude Managed Agents Với Chi Phí Thấp Hơn | Daily News