SenseTime Ra Mắt SenseNova U1.5-Lite Hợp Nhất Mô Hình Suy Luận Qua Chưng Cất OPD
SenseTime đã ra mắt SenseNova U1.5-Lite, một mô hình đa phương thức mã nguồn mở với 8 tỷ (8B) tham số, giúp hợp nhất các mô hình chuyên gia chuyên biệt thành một mô hình suy luận duy nhất. Mô hình này sử dụng phương pháp Chưng cất theo chính sách (On-Policy Distillation - OPD) để hợp nhất các khả năng kết xuất văn bản, thẩm mỹ và chỉnh sửa hình ảnh mà không cần bộ định tuyến Hỗn hợp chuyên gia (MoE). Phương pháp này loại bỏ chi phí tính toán và sự phức tạp của việc định tuyến Hỗn hợp chuyên gia (MoE) trong quá trình suy luận nhưng vẫn giữ được hiệu suất cao của các chuyên gia chuyên biệt. Nó chứng minh một hướng đi khả thi cho các mô hình nhẹ nhằm đạt được khả năng cấp thương mại trong các tác vụ đa phương thức phức tạp như tạo ảnh 4K gốc và chỉnh sửa chính xác. SenseNova U1.5-Lite hỗ trợ độ dài ngữ cảnh gốc từ 3-4k và tích hợp học tăng cường (RL) hướng tác vụ tập trung vào việc tuân thủ hướng dẫn, chất lượng hình ảnh và độ trung thực khi chỉnh sửa. Mô hình tận dụng giám sát cấu trúc JSON nội bộ để kiểm soát chính xác các mối quan hệ không gian và bố cục, trong khi vẫn duy trì giao diện ngôn ngữ tự nhiên cho người dùng.
## KIẾN THỨC NỀN
Trong các kiến trúc Hỗn hợp chuyên gia (MoE) truyền thống, một bộ định tuyến sẽ điều hướng các đầu vào đến các mạng con chuyên biệt (chuyên gia) trong quá trình suy luận, điều này làm tăng chi phí tính toán. Chưng cất theo chính sách (On-Policy Distillation - OPD) là một kỹ thuật học máy trong đó mô hình học sinh học hỏi từ các đầu ra của mô hình giáo viên được tạo ra trong quá trình huấn luyện thực tế của chính nó, giúp giảm thiểu sự sai lệch phân phối và cho phép một mô hình duy nhất hấp thụ nhiều khả năng chuyên biệt.