~/MACHINE LEAR/architectural-innovations-in-llms-looped-transformers-recurrent-depth-and-latent-reasoning

Đột phá kiến trúc LLM: Looped Transformer, Recurrent Depth và suy luận ẩn

Nhà nghiên cứu AI Sebastian Raschka đã xuất bản bài phân tích kỹ thuật về các nghiên cứu gần đây liên quan đến kiến trúc Looped Transformer, Recurrent Depth và suy luận ẩn (Latent Chain-of-Thought). Bài viết đi sâu vào cách việc lặp lại các trạng thái ẩn (hidden states) qua các lớp transformer dùng chung giúp mô hình thực hiện suy luận thuật toán phức tạp mà không làm tăng số lượng tham số. Bằng cách tái sử dụng các khối transformer liên kết trọng số theo chu kỳ, các mô hình có thể mô phỏng tính toán sâu và thực hiện suy luận phức tạp mà vẫn tối ưu hiệu quả tham số. Sự chuyển dịch sang suy luận trong không gian ẩn (latent space) giúp LLM suy nghĩ trực tiếp dưới dạng biểu diễn vectơ thay vì chỉ phụ thuộc vào việc tạo từng token văn bản tường minh. Looped Transformer sử dụng kỹ thuật mở lặp độ sâu liên kết trọng số (weight-tied depth unrolling) để mô phỏng năng lực của mạng thần kinh sâu trong khi giữ số lượng tham số ở mức thấp. Thêm vào đó, các phương pháp suy luận ẩn thực hiện suy luận nhiều bước qua các trạng thái ẩn liên tục, giúp giảm đáng kể chi phí tính toán so với các chuỗi suy luận bằng ngôn ngữ tự nhiên truyền thống.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn (LLM) tiêu chuẩn hoạt động như các mạng truyền thẳng (feedforward) với độ sâu cố định, tạo văn bản theo từng token bằng các chuỗi suy luận từng bước tường minh (Chain-of-Thought). Trái lại, kiến trúc Recurrent Depth và Looped Transformer đưa đầu ra của trạng thái ẩn quay trở lại các lớp tương tự, mô phỏng cách các mạng thần kinh hồi quy (RNN) xử lý thông tin theo chu kỳ lặp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#Transformers#LLMs#AI Research#Deep Learning

$ subscribe --daily

Đột phá kiến trúc LLM: Looped Transformer, Recurrent Depth và suy luận ẩn | Daily News