01Tối ưu hóa tráo đổi VRAM giúp tăng 2.2-2.5 lần tốc độ prefill cho mô hình MoE trên GPU phổ thôngREDDIT · /u/Extension-Bid-639 · reddit.com · 02:39 10 thg 911h
02Thử nghiệm Qwen3.8-Flash-Next: SGLang nhanh hơn llama.cpp 7,3 lần về thời gian tạo token đầu tiênREDDIT · /u/FantasticNature7590 · reddit.com · 19:26 08 thg 91d
03LayerStoRm Cho Phép Trực Tuyến Mô Hình MoE Tốc Độ Cao Vượt Giới Hạn VRAM GPUREDDIT · /u/CharacterBumblebee99 · reddit.com · 01:14 07 thg 93d
04Công cụ mới "cache-pressure" giúp kiểm tra việc giải phóng bộ nhớ KV Cache trên LLM localREDDIT · /u/t4a8945 · reddit.com · 09:38 06 thg 94d
05SGLang Ra Mắt Phiên Bản v0.5.19 Bổ Sung Hỗ Trợ Mô Hình Mới Và Tối Ưu Hiệu NăngGITHUB · Qiaolin-Yu · github.com · 02:27 05 thg 95d
06MTP được tích hợp vào ik_llama.cpp, gấp đôi tốc độ suy luận Qwen khi lập trìnhREDDIT · /u/Alternative_Will5974 · reddit.com · 16:30 03 thg 96d
07Perplexity mở mã nguồn công cụ suy luận 'Lily' dành cho Apple SiliconREDDIT · /u/Specter_Origin · reddit.com · 22:13 02 thg 97d
08Lý do vLLM đạt tốc độ prefill nhanh vượt trội so với llama.cpp trên hệ thống nhiều GPUREDDIT · /u/dangerous_inference · reddit.com · 17:05 01 thg 98d
09Lập trình viên đẩy tốc độ suy luận LLM 27B lên 2.000 token/giây trên RTX 3090REDDIT · /u/iamMess · reddit.com · 11:43 01 thg 99d
10Cập nhật ExLlamaV3 bổ sung CPU Offload cho MoE và định lượng tự hiệu chỉnhREDDIT · /u/Unstable_Llama · reddit.com · 07:14 01 thg 99d
11llama.cpp v0.3.0 ra mắt, hỗ trợ GLM-4.5-Air và DeepSeek 4GITHUB · github-actions[bot] · github.com · 10:22 25 thg 816d
12Moore Threads phát hành sách trắng Prefill-as-a-Service cho GPU MTT S5000RSS · IT HOME · ithome.com · 02:09 24 thg 817d
13Sự trưởng thành và ứng dụng rộng rãi của Speculative Decoding trong suy luận LLM năm 2026REDDIT · /u/Ok-River5924 · reddit.com · 08:02 10 thg 831d
14Nhà phát triển chạy mô hình LFM-2.5 2.6B trên CPU di động đạt 17 token/giâyREDDIT · /u/trikboomie · reddit.com · 14:20 05 thg 836d
15llama.cpp b10228 Ra Mắt Hỗ Trợ DeepSeek-V4 MTP và DSparkGITHUB · github-actions[bot] · github.com · 13:28 02 thg 839d
16llama.cpp Thêm Hỗ Trợ MTP và DSpark cho DeepSeek V4 FlashREDDIT · /u/rmhubbert · reddit.com · 12:58 02 thg 839d
17OpenAI dùng GPT-5.6 Sol để tối ưu hóa suy luận và giảm 20% chi phí vận hànhRSS · IT HOME · ithome.com · 06:06 30 thg 742d
18llama.cpp Phát Hành Bản Dựng b10150 Với Các Điều Chỉnh Offload BackendGITHUB · github-actions[bot] · github.com · 12:45 27 thg 745d