~/AI CODING AG/benchmark-compares-claude-code-opencode-and-pi-agent-harnesses

Thử nghiệm so sánh hiệu năng giữa các khung đại lý Claude Code, OpenCode và Pi

Một thử nghiệm so sánh các khung đại lý (harness) lập trình AI gồm Claude Code, OpenCode và Pi sử dụng mô hình DeepSeek V4 Flash cho thấy dù chất lượng mã nguồn tạo ra là như nhau, thời gian thực thi và lượng token tiêu thụ lại khác biệt rất lớn. Cụ thể, Claude Code mất thời gian lâu hơn gần gấp bốn lần so với khung đại lý nhanh nhất để hoàn thành cùng một tác vụ. Điều này nhấn mạnh rằng khung đại lý (scaffolding) bao bọc xung quanh Mô hình Ngôn ngữ Lớn (LLM) đóng vai trò quyết định đối với hiệu quả vận hành, ảnh hưởng trực tiếp đến chi phí và độ trễ ngay cả khi dùng chung một mô hình nền tảng. Nó chuyển dịch sự chú ý của các kỹ sư AI từ việc chỉ tập trung vào chất lượng mô hình sang tối ưu hóa kiến trúc đại lý. Thử nghiệm được thực hiện bằng cách chạy DeepSeek V4 Flash trên vLLM với tốc độ khoảng 180 token/giây, cô lập khung đại lý làm biến số duy nhất. Sự khác biệt bắt nguồn từ cách mỗi khung cấu trúc gợi ý hệ thống (system prompt), xử lý các lệnh gọi công cụ (tool call) và khám phá cơ sở mã nguồn, trong đó Claude Code có xu hướng tìm kiếm quá mức cần thiết.

## KIẾN THỨC NỀN

Trong kỹ nghệ AI, "harness" hay "scaffolding" (khung đại lý) là khung bao bọc (gồm các gợi ý hệ thống, sơ đồ công cụ và logic thực thi) giúp biến một LLM thô thành một đại lý hoạt động có khả năng tương tác với cơ sở mã nguồn. vLLM là một công cụ mã nguồn mở có hiệu năng cao được thiết kế để suy luận và phục vụ LLM một cách hiệu quả.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Coding Agents#LLM Benchmarks#DeepSeek#Software Engineering#LLM Efficiency

$ subscribe --daily

Thử nghiệm so sánh hiệu năng giữa các khung đại lý Claude Code, OpenCode và Pi | Daily News