Microsoft vô tình làm rò rỉ việc OpenAI dùng kiến trúc Looped Transformer cho GPT-6
Một trang web được truy cập ngắn hạn của Microsoft tiết lộ rằng OpenAI đang sử dụng kiến trúc looped transformer với nhiều lượt suy luận (inference passes) trong các mô hình dòng GPT-6 chưa ra mắt. Trang này đề cập cụ thể đến biến thể mô hình GPT-6.1 Sol sử dụng hai lượt suy luận thay vì ba, trước khi Microsoft nhanh chóng gỡ bỏ nội dung. Nếu chính xác, điều này xác nhận một sự chuyển dịch kiến trúc quan trọng hướng tới thiết kế tối ưu tham số, cho phép các mô hình ngôn ngữ thế hệ tiếp theo đạt khả năng suy luận sâu hơn bằng cách tái sử dụng các lớp mạng thay vì chỉ tăng quy mô tham số. Nó cũng cung cấp bằng chứng thực tế củng cố các tin đồn lâu nay về việc thay đổi kiến trúc của OpenAI cho các mô hình tương lai. Looped transformer liên tục truyền dữ liệu trung gian qua các khối transformer dùng chung trọng số nhằm mô phỏng tính toán sâu hơn với ít tham số hơn. Theo bài đăng bị rò rỉ, các biến thể như GPT-6 Sol và GPT-6.1 Sol chia sẻ chung trọng số mô hình nền tảng tiền huấn luyện nhưng khác nhau ở công đoạn tinh chỉnh hậu huấn luyện và số lượt suy luận.
## KIẾN THỨC NỀN
Kiến trúc transformer tiêu chuẩn xử lý dữ liệu đầu vào thông qua một chuỗi cố định gồm các lớp riêng biệt trong một lượt truyền thẳng (forward pass) duy nhất. Ngược lại, looped transformer tái sử dụng lặp đi lặp lại một tập hợp các lớp transformer theo chiều sâu, giúp mô hình tối ưu hóa tham số hơn đáng kể. Thiết kế lặp này cho phép các mô hình mở rộng linh hoạt khối lượng tính toán cho các tác vụ suy luận phức tạp mà không làm tăng dung lượng của mô hình.