Bài phân tích trên Reddit đưa ra giả thuyết OpenAI dùng kiến trúc looped transformer
Một bài viết trên Reddit đã phân tích các chỉ số rò rỉ từ Azure Foundry và tốc độ suy luận để đưa ra giả thuyết rằng các mô hình chưa ra mắt của OpenAI có thể đang dùng kiến trúc looped transformer. Giả thuyết này cho rằng các mô hình như GPT-6 Astra và Sol có thể thực hiện quá trình tạo token qua nhiều lượt (multi-pass) với cùng một bộ trọng số để tăng độ sâu hiệu dụng trong khi vẫn kiểm soát được chi phí suy luận. Việc chứng minh kiến trúc mô hình dạng vòng lặp (looped) hoặc lồng nhau (nested) có thể vận hành hiệu quả ở quy mô lớn sẽ mở ra hướng đi tối ưu tham số để phát triển mô hình AI thay vì chỉ tăng dung lượng tham số thuần túy. Nếu được xác minh, điều này có thể thúc đẩy các nhóm phát triển mã nguồn mở như DeepSeek hoặc Qwen thử nghiệm các kỹ thuật tái diễn đa lượt tương tự. Bài viết so sánh tốc độ suy luận—chẳng hạn như GPT-6.1 Sol giảm xuống còn khoảng 60 token/giây tương tự như Astra—để đưa ra giả thuyết về các chu kỳ chờ suy luận theo lô và việc tái sử dụng tham số giữa các biến thể. Tuy nhiên, các phép tính này hoàn toàn mang tính đầu cơ và dựa trên các tin đồn chưa được kiểm chứng cùng quan sát benchmark chứ không có tài liệu kỹ thuật chính thức từ OpenAI.
## KIẾN THỨC NỀN
Kiến trúc looped transformer tái sử dụng một nhóm lớp transformer cố định theo cơ chế lặp qua nhiều lượt tính toán xuôi (forward pass) để xử lý một token, thay vì xếp chồng tuyến tính nhiều lớp riêng biệt. Phương pháp này giúp giảm bớt dung lượng tham số nhưng vẫn đạt được ưu thế suy luận của các mô hình sâu hơn, dù mỗi vòng lặp bổ sung sẽ tiêu tốn thêm thời gian tính toán trong quá trình tạo token.