Kiến trúc hậu Transformer BDH của Pathway đạt hiệu suất mở rộng tương đương GPT-2 trên GPU thông thường
Pathway đã giới thiệu Baby Dragon Hatchling (BDH), một kiến trúc hậu Transformer mới đạt hiệu suất mở rộng tương đương với GPT-2 từ 10 triệu đến 1 tỷ tham số. Mô hình này được huấn luyện từ đầu và được thiết kế để chạy hiệu quả trên các GPU tiêu dùng thông thường. Sự phát triển này mở ra một giải pháp thay thế tiềm năng cho kiến trúc Transformer đang thống trị, nhằm giải quyết các vấn đề như khả năng khái quát hóa theo thời gian và chi phí tính toán cao. Bằng cách chạy trên các GPU thông thường, nó có thể bình dân hóa việc huấn luyện và triển khai các mô hình ngôn ngữ lớn tùy chỉnh. BDH là một kiến trúc lấy cảm hứng từ sinh học, kết nối các nguyên lý học sâu với nền tảng của khoa học thần kinh để cải thiện khả năng khái quát hóa theo thời gian. Mặc dù việc đạt hiệu suất mở rộng tương đương GPT-2 chỉ là một thử nghiệm cơ bản, kiến trúc này được thiết kế để hỗ trợ các hệ thống AI thích ứng và học hỏi liên tục.
## KIẾN THỨC NỀN
Kiến trúc Transformer đã thống trị lĩnh vực học sâu nhưng gặp phải hạn chế về độ phức tạp tính toán bậc hai khi chiều dài chuỗi tăng lên, gây tốn kém tài nguyên. Các nhà nghiên cứu đang khám phá các kiến trúc "hậu Transformer" nhằm đạt được khả năng mở rộng tuyến tính, lưu trữ bộ nhớ tốt hơn và khả năng học hỏi liên tục mà không cần các cụm máy tính khổng lồ.