Cộng đồng khám phá các ứng dụng thực tế của mô hình đưa ra quyết định cục bộ như Jev
Một người dùng trên subreddit r/LocalLLaMA đã khởi xướng cuộc thảo luận nhằm tìm kiếm các ứng dụng thực tế cho việc vận hành các mô hình đưa ra quyết định cục bộ như Jev, bên cạnh việc kiểm thử đánh giá sâu (deep eval). Tác giả lưu ý rằng mặc dù các mô hình này hoạt động tốt trong việc đánh giá, việc tìm kiếm các kịch bản triển khai thực tế rộng lớn hơn đôi khi mang lại cảm giác như một 'giải pháp đang tìm kiếm bài toán'. Khi các kiến trúc AI ngày càng đa dạng hóa thay vì chỉ tập trung vào các chatbot trò chuyện, việc hiểu rõ giá trị thực tế của các mô hình đưa ra quyết định chuyên biệt giúp các nhà phát triển tích hợp AI nhanh chóng, có cấu trúc vào quy trình phần mềm. Điều này làm nổi bật sự quan tâm ngày càng tăng đối với các mô hình nhỏ, độ trễ thấp được tối ưu hóa cho việc phân loại tự động, định tuyến và xử lý logic ở cấp hệ thống. Không giống như các LLM truyền thống tạo văn bản trò chuyện theo từng token, các mô hình quyết định 'System One' như Jev đánh giá ngữ cảnh đầu vào để xuất ra các quyết định an toàn về kiểu dữ liệu và có hiệu chỉnh mà không sinh ra văn bản phi cấu trúc. Các ứng dụng hiện tại chủ yếu tập trung vào phân loại dữ liệu tự động, định tuyến quyết định cho tác tử AI và đo kiểm LLM bằng các khuôn khổ như DeepEval.
## KIẾN THỨC NỀN
Các Mô hình Ngôn ngữ Lớn (LLM) tiêu chuẩn thường tạo phản hồi bằng ngôn ngữ tự nhiên một cách tuần tự, điều này có thể gây ra độ trễ và khó khăn trong việc định dạng dữ liệu khi tích hợp vào các quy trình phần mềm tự động. Ngược lại, các mô hình quyết định—thường được mô tả là mô hình 'System One'—tập trung vào việc nạp ngữ cảnh phi cấu trúc và trả về các lựa chọn có cấu trúc với tốc độ máy tính. DeepEval là một khuôn khổ đánh giá nguồn mở để kiểm thử các ứng dụng LLM, vốn thường sử dụng phương pháp LLM làm giám khảo để tự động đánh giá kết quả đầu ra của mô hình.