~/LLMS/prompt-caching-issue-in-deepseek-v4-flash-0731-and-the-latest-reminder

Lỗi bộ nhớ đệm prompt trên DeepSeek-V4-Flash-0731 và cách khắc phục bằng 'latest_reminder'

Các nhà phát triển đã phát hiện ra rằng việc chèn tin nhắn hệ thống (system message) vào giữa cuộc hội thoại trên DeepSeek-V4-Flash-0731 sẽ làm mất hiệu lực của bộ nhớ đệm prompt (prompt cache). Điều này xảy ra do mẫu chat (chat template) của mô hình tự động đẩy tất cả các tin nhắn hệ thống lên trên cùng, làm hỏng phần tiền tố đã được lưu trong bộ nhớ đệm. Bộ nhớ đệm prompt (prompt caching) đóng vai trò quan trọng trong việc giảm độ trễ và chi phí API khi xử lý các cuộc hội thoại dài, nhiều lượt. Việc hiểu rõ đặc điểm này của mẫu chat giúp các nhà phát triển tối ưu hóa hiệu năng và tránh các chi phí không đáng có khi sử dụng DeepSeek-V4-Flash-0731. Để tránh làm mất hiệu lực bộ nhớ đệm, các nhà phát triển nên sử dụng vai trò (role) `latest_reminder` thay vì vai trò `system` tiêu chuẩn cho các chỉ dẫn ở giữa cuộc hội thoại. Vai trò này được hỗ trợ mặc định trong quá trình huấn luyện của DeepSeek và hoạt động mượt mà với các công cụ như llama.cpp.

## KIẾN THỨC NỀN

Bộ nhớ đệm prompt (prompt caching) lưu trữ phần tiền tố của prompt (như chỉ dẫn hệ thống và lịch sử hội thoại ban đầu) để LLM không phải xử lý lại trong các lượt tiếp theo. Các mẫu chat (chat template), thường được viết bằng Jinja, xác định cách định dạng lịch sử tin nhắn có cấu trúc (system, user, assistant) thành một chuỗi văn bản thô duy nhất cho mô hình. Nếu mẫu chat tự động sắp xếp lại tin nhắn—chẳng hạn như di chuyển các chỉ dẫn hệ thống ở giữa cuộc hội thoại lên đầu—phần tiền tố sẽ bị thay đổi, khiến bộ nhớ đệm không còn tác dụng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#DeepSeek#Prompt Caching#AI Engineering

$ subscribe --daily

Lỗi bộ nhớ đệm prompt trên DeepSeek-V4-Flash-0731 và cách khắc phục bằng 'latest_reminder' | Daily News