~/MACHINE LEAR/reasoning-medical-27b-a-new-medical-llm-fine-tuned-with-grpo-and

Reasoning-Medical-27B: Mô hình ngôn ngữ y tế mới được tinh chỉnh bằng GRPO và Unsloth

EpistemeAI đã phát hành Reasoning-Medical-27B, một mô hình ngôn ngữ lớn chuyên biệt cho ngành y tế được tinh chỉnh từ Qwen3.6-27B. Mô hình này được huấn luyện trên 370.000 ví dụ câu hỏi và câu trả lời chất lượng cao bằng phương pháp GRPO (Group Relative Policy Optimization) và Unsloth. Mô hình này chứng minh việc ứng dụng học tăng cường và các kỹ thuật lập luận vào các lĩnh vực chuyên sâu như y học lâm sàng và di truyền học. Nó cung cấp một giải pháp thay thế mã nguồn mở cho các tác vụ lập luận y tế nâng cao vốn thường đòi hỏi tài nguyên tính toán khổng lồ. Mô hình tích hợp lập luận Chain-of-Thought để cải thiện khả năng giải quyết từng bước các vấn đề lâm sàng và sinh học. Mặc dù đã có sẵn trên Hugging Face kèm bản thử nghiệm (demo), phiên bản ban đầu này vẫn thiếu các chỉ số đánh giá chi tiết để so sánh hiệu năng với các mô hình LLM y tế khác.

## KIẾN THỨC NỀN

Group Relative Policy Optimization (GRPO) là một thuật toán học tăng cường hiệu quả giúp cập nhật chính sách bằng cách so sánh một nhóm các đầu ra, giảm tải bộ nhớ so với các phương pháp RLHF truyền thống như PPO. Unsloth là một khung phát triển mã nguồn mở phổ biến được thiết kế để tăng tốc quá trình tinh chỉnh LLM và giảm mức sử dụng bộ nhớ, giúp việc huấn luyện các mô hình lớn trên phần cứng thông thường trở nên dễ dàng hơn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#Medical AI#Fine-Tuning#GRPO#Open Source LLMs

$ subscribe --daily