Disaggregated Serving: Memisahkan Prefill & Decode Node
I2 — Inference Engines: vLLM, PagedAttention & Continuous Batching
Arsitektur Serving Generasi Berikutnya: Split Prefill & Decode
1. Karakteristik Komputasi yang Bertentangan
- Prefill (Prompt): Compute-bound, throughput TFLOPS tinggi, membutuhkan GPU dengan Tensor Cores buas (misal NVIDIA H100).
- Decode (Generation): Memory-bandwidth bound, throughput ditentukan oleh lebar bus HBM, tidak membutuhkan TFLOPS raksasa (cocok di GPU seperti L40S atau A10G).
2. Arsitektur Disaggregated (Split Cluster)
[Client Prompt] ──> [Prefill Worker Pool (H100)]
│
(Transfer KV Cache via RDMA)
↓
[Decode Worker Pool (L40S Cluster)] ──> [Streaming Response]
Dengan memisahkan worker pool, sistem dapat melakukan penskalaan independen: menambah node Decode saat concurrency pengguna melonjak, atau menambah node Prefill saat dokumen yang dianalisis bertambah panjang.
I2