Project: Benchmark vLLM Server & Concurrency Stress Test
I2 — Inference Engines: vLLM, PagedAttention & Continuous Batching
Deploy server inferensi vLLM secara lokal atau cloud, konfigurasikan parameter alokasi memori, dan jalankan stress testing performa pada berbagai tingkat concurrency.
Yang Dibangun
- Server vLLM OpenAI-compatible yang menjalankan model open-weights (Qwen / LLaMA).
- Benchmark script asynchronous yang mengukur Time-To-First-Token (TTFT), Time-Per-Output-Token (TPOT), dan Total Throughput (tok/s).
Langkah pengerjaan
- Install vLLM dan deploy model terbuka (mis. Qwen-2.5-7B-Instruct / Llama-3-8B)
- Konfigurasi flag performa: --gpu-memory-utilization 0.90 dan --enable-chunked-prefill
- Kirim request inferensi streaming menggunakan client async HTTP / OpenAI Python SDK
- Jalankan benchmark stress test dengan concurrency 1, 4, 8, 16, dan 32 virtual users
- Kompilasi tabel perbandingan TTFT p95 dan Throughput total ke dalam laporan README
I2