Prompt & semantic caching
M10 — AI Engineering di Production
Arsitektur Caching Produksi
1. Tiga Tingkat Caching
- Exact Prompt Caching: Menyimpan respons untuk hash prompt yang identik 100%.
- Semantic Caching: Menggunakan embedding untuk mencari pertanyaan user yang memiliki makna semantik serupa (similarity > 0.95) dari cache Redis/DB.
- KV Cache Prefix Sharing: Inference engine menyimpan KV cache dari system prompt panjang agar request berikutnya langsung melompat ke fase decoding.
2. Estimasi Ukuran VRAM KV Cache
Ukuran KV Cache per token dihitung dengan formula:
M10