~/EDGE AI/open-source-engine-enables-fast-local-voice-ai-on-jetson-orin

Công Cụ Mã Nguồn Mở Giúp AI Trò Chuyện Bằng Giọng Nói Tốc Độ Cao Trên Jetson Orin

Nhà phát triển `cortexist` đã phát hành 'little-gemma', một công cụ thực thi (inference engine) mã nguồn mở bằng C/CUDA nhằm hỗ trợ hội thoại giọng nói thời gian thực cho các mô hình Gemma trên GPU NVIDIA và thiết bị biên Jetson Orin. Dự án đạt độ trễ thấp hơn llama.cpp, đồng thời hỗ trợ đồng bộ nhép môi, biểu cảm khuôn mặt và cử chỉ mà không bị giảm hiệu năng khi xử lý prompt dài. Dự án chứng minh tính khả thi của việc chạy các agent AI giao tiếp giọng nói tương tác cao hoàn toàn cục bộ trên thiết bị biên như robot và hệ thống nhúng mà không phụ thuộc vào dịch vụ đám mây. Việc xây dựng một công cụ CUDA tùy chỉnh vượt trội hơn các framework tổng quát trên thiết bị mục tiêu tạo tiền đề cho các ứng dụng AI vật lý thời gian thực độ trễ thấp. Hệ thống vận hành Gemma 4 12B trên RTX PRO 4500 Blackwell và Gemma 4 E2B trên Jetson Orin NX 16GB, sử dụng mảng 4 micro reSpeaker Flex cùng loa 3W cho đầu vào/ra âm thanh. Công cụ siêu nhẹ này xử lý đồng thời suy luận LLM, xử lý âm thanh và hoạt hình nhân vật cho việc tương tác thoại giữa robot với robot hoặc giữa người với robot.

## KIẾN THỨC NỀN

NVIDIA Jetson Orin là dòng hệ thống nhúng (system-on-module) nhỏ gọn được thiết kế cho các ứng dụng AI trên thiết bị biên (edge AI) hiệu năng cao như robot tự hành và hệ thống thị giác máy tính. Trong khi đó, llama.cpp là một thư viện mã nguồn mở C/C++ phổ biến được tối ưu hóa để chạy suy luận LLM cục bộ trên nhiều nền tảng phần cứng khác nhau.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Edge AI#CUDA#LLM Inference#Jetson Orin#Open Source

$ subscribe --daily

Công Cụ Mã Nguồn Mở Giúp AI Trò Chuyện Bằng Giọng Nói Tốc Độ Cao Trên Jetson Orin | Daily News