FreedomIntelligence ra mắt HuatuoGPT-3-27B với phương pháp huấn luyện OnePO không cần SFT
FreedomIntelligence đã phát hành HuatuoGPT-3-27B, một mô hình ngôn ngữ lớn chuyên ngành y tế được huấn luyện bằng kỹ thuật mới mang tên One-stage Policy Optimization (OnePO). Cùng với trọng số mô hình, nhóm phát triển đã mở mã nguồn huấn luyện, tập dữ liệu học tăng cường y tế và một mô hình chấm điểm quy chuẩn (rubric grader) 8B. OnePO thách thức quy trình huấn luyện LLM truyền thống bằng cách bỏ qua hoàn toàn giai đoạn Tinh chỉnh có giám sát (SFT) chuyên ngành để đi thẳng vào học tăng cường trực tiếp. Phương pháp này giúp đơn giản hóa việc thích ứng mô hình cho các lĩnh vực phức tạp như y tế, đồng thời cho phép mô hình học tập hiệu quả nhờ sự hướng dẫn động từ mô hình giáo viên. Được xây dựng dựa trên mô hình nền tảng Qwen 27B, HuatuoGPT-3 sử dụng đầu ra tạm thời từ mô hình giáo viên để khởi tạo nhanh kiến thức y khoa trong giai đoạn đầu huấn luyện. Khi mô hình cải thiện, sự hướng dẫn của giáo viên sẽ tự động rút lui để chuyển sang giai đoạn tự khám phá bằng RL, giúp tránh hiện tượng cạn kệt độ dốc (gradient starvation).
## KIẾN THỨC NỀN
Theo truyền thống, việc chuyển đổi các LLM tiền huấn luyện tổng quát sang các lĩnh vực chuyên sâu đòi hỏi quy trình hai bước: Tinh chỉnh có giám sát (SFT) trên dữ liệu ngành và sau đó là Căn chỉnh bằng Học tăng cường (RL). HuatuoGPT là một hệ sinh thái AI y tế mở được phát triển bởi FreedomIntelligence nhằm thúc đẩy khả năng suy luận lâm sàng và hỗ trợ chăm sóc sức khỏe tự động.