Kernel GPU vs Inference Engine: Memahami Batas & Peran
I1 — GPU Kernels: Dari CUDA ke Triton & FlashAttention
Membedah Miskonsepsi: Kernel vs vLLM
Di komunitas AI engineering sering muncul pertanyaan: "Apakah Kernel itu kompetitor vLLM?" Jawabannya: Sama sekali bukan. Mereka bekerja pada level abstraksi yang berbeda!
1. Analogi Dapur Restoran
| Komponen Sistem | Analogi Restoran | Tanggung Jawab Nyata |
|---|---|---|
| Model LLM | Resep Masakan | Bobot parameter, topologi layer, dan arsitektur Transformer. |
| GPU Hardware | Fisik Dapur & Kompor | Chip silikon, core SM, Tensor Cores, dan VRAM. |
| GPU Kernel | Koki Spesialis | Potongan kode C++/CUDA/Triton yang mengerjakan satu tugas matematika spesifik secepat kilat (mis. "Kalikan Matriks di SRAM"). |
| vLLM / Engine | Kepala Dapur & Manajer Antrian | Mengatur ratusan pesanan pelanggan (batching), memesan ruang meja (KV cache allocation), dan memanggil koki (kernel) yang tepat. |
| API Server | Pelayan Restoran | Menerima request HTTP JSON dari user dan mengembalikan streaming response. |
2. Diagram Aliran Eksekusi
Aplikasi User / Chatbot
│
OpenAI-Compatible API
│
vLLM (Inference Engine)
┌────────────┴────────────┐
│ │
Scheduler (Batching) KV Cache Manager (PagedAttention)
│
Eksekusi Komputasi GPU
│
┌─────────┴──────────┐
│ │
CUDA / Triton FlashAttention
Fused Kernels Kernels
│ │
└────── GPU Hardware ┘
Kesimpulan:
- Kernel GPU: Blok pembangun komputasi level rendah (low-level computational building block).
- vLLM: Framework inferensi level tinggi (high-level inference engine) yang memanfaatkan kernel-kernel tersebut untuk melayani banyak pengguna secara efisien.
I1