Capstone: High-Throughput LLM Production Cluster
I4 — Advanced Optimization: Quantization, Speculative Decoding & Production LLMOps
Bangun arsitektur cluster inferensi LLM siap produksi dengan vLLM, kuantisasi AWQ / FP8, Speculative Decoding aktif, dan dashboard monitoring observabilitas Prometheus/Grafana.
Yang Dibangun
- Server inferensi terkuantisasi dengan akselerasi Speculative Decoding.
- Reverse proxy dan dashboard observabilitas yang memantau metrik real-time: GPU VRAM, TTFT p95, TPOT, Throughput tok/s, dan Cache Hit Rate.
Langkah pengerjaan
- Deploy model terkuantisasi AWQ / FP8 menggunakan vLLM engine
- Konfigurasikan integrasi Speculative Decoding dengan draft model yang kompatibel
- Aktifkan Prometheus metrics endpoint dari vLLM (--enable-metrics)
- Bangun visualisasi dashboard Grafana yang memantau GPU memory, request queue, TTFT, dan tok/s
- Jalankan stress test simulasi 50 pengguna concurrent dan dokumentasikan arsitektur cluster di README
I4