Kapasitas & Sizing Cluster Produksi
I4 — Advanced Optimization: Quantization, Speculative Decoding & Production LLMOps
Menghitung Kebutuhan Server & Arsitektur High Availability
1. Checklist Capacity Sizing
Sebelum memesan instance cloud GPU, hitung kapasitas menggunakan checklist:
- Berapa ukuran model setelah kuantisasi?
- Berapa target concurrency puncak (misal 50 pengguna aktif bersamaan)?
- Berapa rata-rata panjang konteks token ()?
- Berapa total VRAM yang dibutuhkan untuk KV Cache?
2. Arsitektur High Availability (HA)
[ API Gateway / Reverse Proxy ]
│
[ Load Balancer (Least-Tokens) ]
┌──────────────┴──────────────┐
↓ ↓
[ vLLM Instance 1 (GPU 0-1) ] [ vLLM Instance 2 (GPU 2-3) ]
Gunakan algoritma routing cerdas (Least-Tokens Routing atau Session Affinity) agar request dari sesi percakapan yang sama diarahkan ke instance yang sama untuk memaksimalkan prefix cache hit rate.
I4