~/LOCAL LLM/local-ai-practitioner-achieves-3x-speedup-with-ornith-1-5-35b-a3b

Người dùng AI cục bộ tăng tốc suy luận 3 lần nhờ mô hình Ornith 1.5 35B-A3B

Một người thử nghiệm LLM cục bộ trên hệ thống hai GPU RTX 5070 Ti đã ghi nhận tốc độ suy luận tăng gấp 3 lần—đạt khoảng 180 token/giây—khi chuyển từ Qwen3.8 27B sang Ornith 1.5 35B-A3B. Mô hình mới vẫn duy trì tỷ lệ vượt qua 100% trên các bài kiểm tra đánh giá tác vụ agent và lập trình tự tạo. Bài kiểm tra thực tế này cho thấy các kiến trúc Mixture-of-Experts hiện đại kết hợp với cơ chế chú ý tuyến tính hỗn hợp có thể tăng mạnh tốc độ xử lý trên phần cứng tiêu dùng mà không làm giảm năng lực. Điều này khẳng định việc xử lý ngữ cảnh dài (128K+) với tốc độ cao đang ngày càng khả thi cho các ứng dụng AI agent trên máy tính cá nhân. Ornith 1.5 35B-A3B đạt tốc độ suy luận cao do chỉ có khoảng 3 tỷ tham số hoạt động trên mỗi token trong tổng số 256 chuyên gia, và chỉ 10 trong số 41 lớp sử dụng cơ chế chú ý đầy đủ. Nhờ đó, dung lượng bộ đệm KV tăng rất ít, chỉ tốn thêm khoảng 2GB bộ nhớ khi mở rộng cửa sổ ngữ cảnh từ 128K lên 256K token.

## KIẾN THỨC NỀN

Chạy mô hình AI cục bộ đòi hỏi sự cân bằng giữa giới hạn bộ nhớ GPU (VRAM) với tốc độ suy luận và độ dài ngữ cảnh. Các mô hình Mixture-of-Experts (MoE) giảm chi phí tính toán trên mỗi token bằng cách định tuyến linh hoạt đầu vào đến một tập hợp nhỏ các tham số chuyên biệt ('chuyên gia'). Ngoài ra, giải pháp kết nối như OCuLink cho phép máy tính gắn thêm GPU thứ hai để chạy mô hình trên đa GPU với độ trễ thấp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLM#Inference Optimization#Hardware Benchmarks#AI Agents#Model Evaluation

$ subscribe --daily

Người dùng AI cục bộ tăng tốc suy luận 3 lần nhờ mô hình Ornith 1.5 35B-A3B | Daily News