Cộng đồng AI thảo luận về việc tự huấn luyện mô hình để thử nghiệm nghiên cứu mới
Một người dùng Reddit đã khơi dậy cuộc thảo luận trong cộng đồng r/LocalLLaMA về việc tự huấn luyện các mô hình AI từ đầu trên phần cứng cá nhân, đặc biệt là để thử nghiệm các kiến trúc mới như Titans của Google và Engram của DeepSeek. Điều này làm nổi bật xu hướng ngày càng tăng của những người đam mê và nhà nghiên cứu độc lập trong việc sử dụng phần cứng tiêu dùng cao cấp để tự triển khai các nghiên cứu máy học tiên tiến tại địa phương, thay vì phụ thuộc vào điện toán đám mây đắt đỏ. Người dùng đã chia sẻ cấu hình máy tính của họ gồm GPU RTX 5090 và CPU Ryzen 9 9950X3D, đồng thời ví việc thử nghiệm các kiến trúc thực nghiệm như bộ nhớ điều kiện giống như một phiên bản kỹ thuật cao của trò chơi nuôi thú ảo Tamagotchi.
## KIẾN THỨC NỀN
Kiến trúc "Titans" của Google giới thiệu một mô-đun bộ nhớ thần kinh nhằm cung cấp khả năng ghi nhớ dài hạn cho các mô hình AI, giúp giảm thiểu chi phí tính toán bậc hai của mô hình Transformer truyền thống. Trong khi đó, nghiên cứu "Engram" của DeepSeek đề xuất một kiến trúc bộ nhớ có điều kiện, bổ sung thêm một trục thưa thứ hai để tách biệt phần bộ nhớ khỏi phần suy luận trong các mô hình ngôn ngữ lớn.