Project: Menulis Fused Softmax Kernel dengan Triton
I1 — GPU Kernels: Dari CUDA ke Triton & FlashAttention
Tulis kernel GPU Fused Softmax menggunakan OpenAI Triton di Python, verifikasi keakuratan numeriknya terhadap PyTorch, dan ukur peningkatan throughput-nya.
Yang Dibangun
- Kernel Triton kustom yang menggabungkan pengurangan maksimum (safe softmax), eksponensial, dan normalisasi dalam satu blok SRAM.
- Benchmark komparatif kecepatan eksekusi (latency microsecond) vs panjang baris tensor ( hingga ).
Langkah pengerjaan
- Tulis fungsi naive softmax PyTorch dan catat profil memory traffic VRAM
- Implementasikan Fused Softmax kernel menggunakan OpenAI Triton
- Gunakan triton.testing.assert_close untuk memverifikasi akurasi numerik dengan toleransi FP16
- Ukur latency eksekusi pada berbagai dimensi baris (1k, 4k, 16k, 64k)
- Plot grafik Speedup Factor (Triton vs PyTorch native) dan simpan ke README
I1