RadixAttention & Structured Caching (SGLang Pattern)
I4 — Advanced Optimization: Quantization, Speculative Decoding & Production LLMOps
Automatic Prefix Caching dengan Radix Tree
Pada aplikasi nyata (seperti chatbot multi-turn, evaluasi few-shot, atau pemanggilan agen berkali-kali), prompt sistem dan dokumen referensi sering kali memiliki awalan (prefix) yang berulang.
1. Radix Tree KV Cache
Framework modern (seperti SGLang dan vLLM automatic prefix caching) mengelola memori KV Cache menggunakan struktur data Radix Tree (pohon awalan):
- Jika User B mengirim pertanyaan yang memiliki system prompt yang sama dengan User A, server tidak menghitung ulang token prompt tersebut.
- Server langsung mengambil KV cache yang sudah ada di pohon Radix.
2. Manfaat di Lingkungan Produksi
- Time-To-First-Token (TTFT) Turun hingga 90% untuk percakapan multi-turn.
- Menghemat konsumsi daya komputasi GPU secara masif.
I4