~/AI AGENTS/amazon-open-sources-strands-decider-2b-for-low-latency-local-ai-agent

Amazon ra mắt mã nguồn mở Strands Decider 2B cho quyết định AI Agent cục bộ với độ trễ thấp

Nhóm Strands Agents của Amazon đã phát hành mã nguồn mở Strands Decider 2B, một mô hình 2 tỷ tham số chuyên dụng được tối ưu hóa cho việc ra quyết định cục bộ trong quy trình làm việc của AI agent. Được xây dựng bằng cách thay thế đầu sinh văn bản của mô hình nền Qwen3.5-2B bằng đầu chỉ số chấm điểm 1 triệu tham số, mô hình hiện có sẵn trên GitHub và Hugging Face để chạy trên CPU và GPU. Các mô hình ngôn ngữ sinh tạo tiêu chuẩn tốn nhiều độ trễ và chi phí tính toán khi agent chỉ cần chọn một công cụ hoặc lựa chọn hành động. Bằng cách chuyển đổi phần khung của LLM thành một công cụ xếp hạng quyết định nhanh chóng, Amazon giúp xây dựng các hệ thống agent cục bộ phản hồi nhanh mà không phụ thuộc vào API đám mây bên ngoài. Mô hình này tinh chỉnh phần thân Qwen3.5-2B bằng bộ thích ứng LoRA rank-16 kết hợp với một đầu chấm điểm nhỏ gọn. Trên bộ thử nghiệm JevBench, nó vượt qua tất cả các đối thủ cạnh tranh dưới 2 tỷ tham số về độ chính xác và độ hiệu chỉnh, đạt độ trễ quyết định trung vị là 113ms trên phần cứng cục bộ thông thường và 153ms trên NVIDIA GeForce RTX 3090.

## KIẾN THỨC NỀN

Các mô hình LLM truyền thống sinh văn bản theo từng token, gây ra độ trễ cao cho các tác vụ điều hướng cấu trúc trong AI agent đa bước. Kỹ thuật như LoRA (Low-Rank Adaptation) cho phép tinh chỉnh tiết kiệm tham số bằng cách chỉ chỉnh sửa một tập hợp nhỏ trọng số thích ứng bổ sung thay vì huấn luyện lại toàn bộ mô hình nền.

## TỪ KHÓA

#AI Agents#Open Source Models#Machine Learning#Amazon#Edge AI

$ subscribe --daily

Amazon ra mắt mã nguồn mở Strands Decider 2B cho quyết định AI Agent cục bộ với độ trễ thấp | Daily News