LLM Infrastructure
I0–I4: dari kernel komputasi, vLLM, hingga cluster serving multi-GPU skala produksi.
Arsitektur GPU, VRAM, memory bandwidth, Tensor Cores, presisi angka (FP16/BF16/FP8)
Buka bab lengkap →Kernel vs Engine, penulisan kernel CUDA/Triton, fused operations, FlashAttention-1/2/3
Buka bab lengkap →Arsitektur vLLM, PagedAttention, continuous batching, chunked prefill, disaggregated serving
Buka bab lengkap →Tensor Parallelism, Pipeline Parallelism, Expert Parallelism (MoE), Interconnect (NVLink, PCIe)
Buka bab lengkap →Kuantisasi (AWQ, GPTQ, FP8), Speculative Decoding, RadixAttention, Observability Cluster
Buka bab lengkap →Mulai dari nol — tanpa daftar, tanpa paywall
Mulai: I0 Fondasi Hardware & Komputasi GPU →Halaman lesson per-babak + tracking progress.