Đánh giá hiệu năng các mô hình LLM thị giác trong việc ước tính calo bữa ăn
Một nhà phát triển đã thử nghiệm đánh giá nhiều mô hình LLM đa thức trong việc ước tính calo bữa ăn từ hình ảnh và mô tả văn bản trên 25 bữa ăn từ bộ dữ liệu Nutrition5k. Nhờ kết hợp với các công cụ tra cứu dữ liệu thực phẩm, Muse Spark 1.3 đạt kết quả tốt nhất với 48% dự đoán có sai số dưới 20%. Thử nghiệm cho thấy khả năng ứng dụng của các LLM thị giác kết hợp với công cụ tra cứu dữ liệu ngoại vi trong việc tự động hóa theo dõi dinh dưỡng. Nó cũng chứng minh rằng hiệu năng của mô hình cho các tác vụ chuyên biệt trên phần cứng cá nhân không hoàn toàn phụ thuộc vào số lượng tham số. Các mô hình thực hiện đánh giá hàm lượng calo thông qua việc truy cập cơ sở dữ liệu USDA FoodData Central và bảng thành phần thực phẩm MEXT của Nhật Bản. DeepSeek v4 Flash Vision xếp thứ hai với 40% dự đoán đạt mức sai số dưới 20%, trong khi Muse Glimmer 30b vượt trội rõ rệt so với Qwen 3.8 27b dù yêu cầu phần cứng tương đương.
## KIẾN THỨC NỀN
Nutrition5k là bộ dữ liệu mở do Google Research xây dựng, chứa hình ảnh và chỉ số dinh dưỡng chi tiết của khoảng 5.000 đĩa thức ăn thực tế thu thập từ nhà ăn của Google. MEXT là cơ quan quản lý bảng thành phần thực phẩm tiêu chuẩn chính thức của Nhật Bản, cung cấp các thông số tham chiếu chuẩn về chất dinh dưỡng và calo trong thực phẩm.