~/AI ML/llama-cpp-b10549-released-with-tensor-splitting-for-lfm2-and-lfm2moe-models

llama.cpp b10549 Hỗ Trợ Phân Tách Tensor Cho LFM2 và LFM2MOE

Dự án llama.cpp đã phát hành phiên bản b10549, giới thiệu hỗ trợ phân tách tensor cho các mô hình LFM2 và LFM2MOE. Bản cập nhật này được hỗ trợ thực hiện bởi công cụ deepseek-v4-flash. Bản cập nhật này cho phép người dùng chạy các mô hình LFM2 và LFM2MOE của Liquid AI trên nhiều GPU, giúp giảm độ trễ và hỗ trợ chạy các cấu hình mô hình lớn vượt quá dung lượng bộ nhớ của một GPU đơn lẻ. Tính năng phân tách tensor (TP) trong llama.cpp phân phối các lớp transformer trên nhiều GPU để song song hóa khối lượng công việc, mặc dù hiệu năng vẫn bị giới hạn bởi tốc độ kết nối giữa các GPU. Bản phát hành này cũng cung cấp các tệp thực thi biên dịch sẵn cho nhiều nền tảng, tuy nhiên hỗ trợ macOS KleidiAI và openEuler hiện đang bị vô hiệu hóa.

## KIẾN THỨC NỀN

llama.cpp là một công cụ suy luận LLM mã nguồn mở phổ biến được viết bằng C/C++ nhằm tối ưu hóa việc chạy cục bộ hiệu quả. Các mô hình Liquid Foundation Models (LFM), do Liquid AI phát triển, được thiết kế để chạy hiệu quả trên các thiết bị biên như điện thoại và máy tính xách tay trong điều kiện giới hạn bộ nhớ. Phân tách tensor (tensor splitting hay tensor parallelism) là kỹ thuật chia nhỏ các tensor của mô hình trên nhiều bộ tăng tốc phần cứng để vừa vặn các mô hình lớn hơn vào bộ nhớ và tăng tốc độ tính toán.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI/ML#llama.cpp#Open Source#LLM Inference

$ subscribe --daily

llama.cpp b10549 Hỗ Trợ Phân Tách Tensor Cho LFM2 và LFM2MOE | Daily News