Sự quan tâm đối với các phương pháp giảm token và nén prompt của LLM
Một bài đăng trên mạng xã hội đã làm nổi bật sự quan tâm ngày càng tăng của cộng đồng đối với các kỹ thuật mới nổi được cho là giúp giảm tới 90% lượng token sử dụng của Mô hình ngôn ngữ lớn (LLM). Việc giảm lượng token sử dụng là rất quan trọng đối với các nhà phát triển và doanh nghiệp vì nó trực tiếp hạ thấp chi phí API và cải thiện tốc độ tạo văn bản của các ứng dụng chạy bằng LLM. Mặc dù phương pháp cụ thể được nhắc đến trong tweet không được nêu chi tiết, các chiến lược giảm token phổ biến bao gồm nén prompt (như LLMLingua), lưu nháp prompt (prompt caching) và kỹ nghệ ngữ cảnh (context engineering). Những kỹ thuật này nhằm loại bỏ sự dư thừa và đơn giản hóa cấu trúc prompt mà không làm mất đi ý nghĩa ngữ nghĩa.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn xử lý văn bản theo các đơn vị gọi là token, và các nhà cung cấp API tính phí người dùng dựa trên số lượng token đầu vào và đầu ra. Khi các ứng dụng mở rộng quy mô và xử lý các ngữ cảnh dài hơn, chi phí token có thể tăng lên nhanh chóng, thúc đẩy các nghiên cứu về phương pháp tối ưu hóa giúp nén prompt hoặc tái sử dụng ngữ cảnh.