~/AI AGENTS/kolibri-1-model-plays-atari-breakout-real-time-via-output-probabilities

Mô Hình Kolibri-1 Chơi Game Atari Breakout Theo Thời Gian Thực Nhờ Xác Suất Đầu Ra

Các nhà phát triển đã trình diễn mô hình Kolibri-1 của Aleph Alpha chơi trò chơi Atari Breakout theo thời gian thực mà không cần tinh chỉnh. Bằng cách bỏ qua bước tạo văn bản và ánh xạ trực tiếp xác suất đầu ra của token đến bốn hành động trò chơi rời rạc, họ đã đạt được độ trễ suy luận dưới 25 miligiây cho mỗi nước đi. Thử nghiệm này chứng minh rằng các mô hình ngôn ngữ lớn có thể hoạt động như những bộ điều khiển độ trễ cực thấp bằng cách tận dụng xác suất đầu ra thô thay vì tạo văn bản tự hồi quy đầy đủ. Điều này mở ra những khả năng thực tế cho các mô hình mở trọng số trong điều khiển tác tử thời gian thực, ứng dụng tương tác và robot. Cấu hình này tránh hoàn toàn việc tạo token tự hồi quy, trích xuất logits từ lớp softmax cuối cùng của mô hình để chọn ngay lập tức giữa bốn hành động được định sẵn. Vì Kolibri-1 sử dụng kiến trúc Mixture-of-Experts (MoE) chỉ kích hoạt 3,46 tỷ tham số trên tổng số 78,1 tỷ tham số cho mỗi token, việc tối ưu hóa trích xuất xác suất cho phép đạt tốc độ cực cao.

## KIẾN THỨC NỀN

Quá trình tạo văn bản thông thường của Mô hình Ngôn ngữ Lớn (LLM) sử dụng phương pháp giải mã tự hồi quy, trong đó các token được dự đoán tuần tự, gây thêm độ trễ ở mỗi từ. Trước khi chọn một token đầu ra, các lớp tuyến tính và softmax cuối cùng của LLM sẽ tính toán phân phối xác suất thô trên toàn bộ từ vựng. Bằng cách đọc trực tiếp các xác suất token hành động này mà không cần kích hoạt quá trình tạo văn bản nhiều token, các ứng dụng có thể đạt được chu kỳ ra quyết định gần như tức thì.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Agents#LLM Inference#Open Weights#Real-Time AI#VLM

$ subscribe --daily

Mô Hình Kolibri-1 Chơi Game Atari Breakout Theo Thời Gian Thực Nhờ Xác Suất Đầu Ra | Daily News