~/LLAMA CPP/google-s-android-studio-uses-llama-cpp-to-power-native-local-gemma

Android Studio của Google sử dụng llama.cpp để vận hành các mô hình Gemma cục bộ

Các nhà phát triển phát hiện ra rằng tính năng tích hợp trực tiếp các mô hình Gemma cục bộ trong Android Studio chạy trên nền tảng suy luận mã nguồn mở llama.cpp. Cấu hình này hỗ trợ chạy trên nhiều GPU và cửa sổ ngữ cảnh lên tới 128k token cho phiên bản Gemma 31B. Phát hiện này cho thấy các công cụ suy luận LLM mã nguồn mở như llama.cpp đã trở thành tiêu chuẩn ngành, được ngay cả các gã khổng lồ công nghệ như Google áp dụng. Điều này giúp các môi trường phát triển ứng dụng cung cấp các tính năng AI ngoại tuyến, bảo mật và tốc độ cao mà không cần tự xây dựng lại bộ công cụ suy luận từ đầu. Chạy mô hình Gemma 31B với cửa sổ ngữ cảnh 128k yêu cầu khoảng 34 GB VRAM khi tải đầy đủ, nhiều khả năng tận dụng khả năng tăng tốc Vulkan và các trọng số từ Đào tạo nhận biết định lượng (QAT). Tuy nhiên, Android Studio hiện chưa có tùy chọn giao diện để điều chỉnh độ dài ngữ cảnh hoặc hiển thị tốc độ xử lý prompt và tạo token.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để chạy suy luận hiệu năng cao các mô hình ngôn ngữ lớn trên nhiều loại phần cứng khác nhau. Gemma là họ mô hình LLM mở, nhẹ do Google phát triển dựa trên cùng công nghệ với dòng mô hình Gemini. Đào tạo nhận biết định lượng (QAT) là phương pháp tối ưu hóa mô hình trong quá trình huấn luyện nhằm giảm độ chính xác bit, giúp tiết kiệm VRAM mà vẫn duy trì chất lượng mô hình.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#Gemma#Android Studio#Local LLMs#AI Tooling

$ subscribe --daily

Android Studio của Google sử dụng llama.cpp để vận hành các mô hình Gemma cục bộ | Daily News