Ra mắt Nanbeige4.2-3B: Mô hình 3B tham số sử dụng kiến trúc Looped Transformer
Phòng nghiên cứu Nanbeige LLM Lab đã phát hành Nanbeige4.2-3B, một mô hình ngôn ngữ tác nhân nhỏ gọn với 3 tỷ tham số sử dụng kiến trúc Looped Transformer. Kiến trúc này tái sử dụng các lớp transformer theo chu kỳ để tăng dung lượng mô hình mà không cần thêm tham số mới. Sự kiện này chứng minh rằng các mô hình nhỏ gọn vẫn có thể đạt hiệu suất cao trong các tác vụ tác nhân và lập trình, vượt qua các mô hình có kích thước lớn gấp bốn lần. Nó làm nổi bật tiềm năng của các kiến trúc đệ quy tiết kiệm tham số trong các ứng dụng AI thực tế. Được xây dựng trên nền tảng Nanbeige4.2-3B-Base, mô hình này chỉ sở hữu 3 tỷ tham số không nhúng (non-embedding parameters). Thiết kế của nó nhằm kết hợp hành vi tác nhân mạnh mẽ với khả năng suy luận rộng và căn chỉnh tối ưu.
## KIẾN THỨC NỀN
Looped Transformer là một biến thể đệ quy, tiết kiệm tham số của kiến trúc transformer sâu tiêu chuẩn. Thay vì sử dụng một chuỗi các lớp riêng biệt, nó áp dụng lặp đi lặp lại một tập hợp cố định các khối transformer để xử lý thông tin.