Project: Multi-GPU Cluster Simulation & TP Profiling
I3 — Distributed Serving & Parallelism Strategies
Konfigurasikan inferensi terdistribusi menggunakan vLLM dengan Tensor Parallelism pada multi-GPU, ukur overhead komunikasi NCCL, dan evaluasi skalabilitas throughput.
Yang Dibangun
- Setup vLLM dengan
--tensor-parallel-size 2atau4. - Script pengujian transfer komunikasi All-Reduce PyTorch Distributed untuk mengukur latensi bus GPU.
Langkah pengerjaan
- Verifikasi kesiapan multi-GPU lokal/cloud menggunakan torch.cuda.device_count()
- Jalankan vLLM server dengan Tensor Parallelism (TP=2) pada model open-source 7B/14B
- Uji operasi All-Reduce menggunakan backend NCCL dan hitung bandwidth komunikasi efektif
- Bandingkan kecepatan tok/s model pada konfigurasi Single GPU vs TP=2 vs TP=4
- Dokumentasikan hasil analisis scalability efficiency ke dalam README proyek
I3