Context caching & biaya token
M6 — Context Engineering
Ekonomi Komputasi: Prompt Caching & KV Cache
1. Mengapa Context Caching Mengubah Permainan?
Pada alur RAG atau dokumen panjang, bagian prompt yang sama dapat muncul berulang kali. Beberapa provider/inference engine menyediakan Prompt/Prefix Caching:
- Bagian konteks yang dapat digunakan kembali tidak selalu perlu diproses ulang dari nol.
- Penghematan biaya dan latency bergantung pada provider, model, pola cache, dan ukuran prefix yang dapat di-cache. Jangan menganggap satu persentase penghematan berlaku untuk semua sistem.
2. KV Cache di Tingkat Hardware
KV Cache menyimpan vektor Key dan Value dari token-token sebelumnya di VRAM GPU, sehingga saat memproses token baru, model tidak perlu menghitung ulang attention dari seluruh riwayat.
M6