Anatomi GPU: SM, Warp, Tensor Cores & VRAM Hierarchy
I0 — Fondasi Hardware & Komputasi GPU untuk LLM
Memahami Mesin Komputasi di Balik LLM
Menjalankan LLM skala produksi membutuhkan pemahaman mendalam tentang bagaimana perangkat keras GPU mengeksekusi operasi tensor secara fisik.
1. Perbedaan Mendasar: CPU vs GPU
- CPU (Latency-Oriented): Didesain untuk mengeksekusi alur instruksi serial yang kompleks dengan latensi serendah mungkin. Memiliki sedikit core bertenaga tinggi, cache L1/L2/L3 yang sangat besar, dan kontrol percabangan (branch prediction) yang canggih.
- GPU (Throughput-Oriented): Didesain untuk komputasi paralel masif (SIMT: Single Instruction, Multiple Threads). Memiliki ribuan core komputasi kecil yang mengeksekusi operasi matematika identik secara serempak di atas larik data besar.
CPU: [Core 1] [Core 2] [Core 3] [Core 4] + [Large L3 Cache]
GPU: [SM 1: 128 cores] [SM 2: 128 cores] ... [SM 100: 128 cores] + [HBM VRAM]
2. Struktur Streaming Multiprocessors (SM) & Warp
- SM (Streaming Multiprocessor): Unit komputasi independen di dalam GPU (misal NVIDIA H100 memiliki 132–144 SM).
- Warp: Sekelompok 32 thread yang dieksekusi secara lockstep (bersamaan). Jika ada percabangan kode (
if/else), terjadi warp divergence yang menurunkan efisiensi eksekusi. - Tensor Cores: Unit sirkuit keras (hardware execution units) khusus di dalam SM yang melakukan operasi perkalian dan akumulasi matriks (Matrix Multiply-Accumulate / MMA) dalam satu siklus clock tunggal.
3. Hierarki Memori GPU (Dari Tercepat ke Terlambat)
- Register File (Per-thread): Kapasitas sangat kecil (~64 KB per SM), latensi 1 siklus clock, bandwidth > 20 TB/s.
- Shared Memory / L1 Data Cache (Per-SM): Memori terbagi yang dikontrol programmer (~128–228 KB per SM), latensi ~20 siklus clock.
- L2 Cache (Chip-wide): Cache global yang terbagi antar semua SM (~50–60 MB pada H100), latensi ~100–200 siklus.
- High Bandwidth Memory (HBM / VRAM): Memori utama GPU (misal 80 GB HBM3 pada H100), latensi ~400–800 siklus clock, bandwidth 3.35 TB/s.
Hukum Utama GPU: Setiap kali data harus dibaca atau ditulis kembali ke HBM/VRAM utama, GPU membayar penalti latensi ratusan siklus. Kunci optimasi performa adalah menjaga data tetap berada di Register dan Shared Memory (SRAM)!
I0