Dropout, weight decay, optimizer
M3 — Deep Learning
Teknik Regularisasi & Optimizer Modern
1. Mengatasi Overfitting
- Dropout: Secara acak mematikan persentase neuron (mis. 20–50%) selama training untuk mencegah co-adaptation antar fitur.
- Weight Decay (L2 Regularization): Menambahkan penalti kuadrat bobot ke fungsi loss agar bobot tidak membesar secara ekstrem.
- Layer Normalization: Menormalisasi aktivasi sepanjang dimensi fitur per sampel — teknik standar pada arsitektur Transformer.
2. Optimizer: Dari SGD ke AdamW
- SGD with Momentum: Mempercepat pergerakan di arah gradien yang konsisten.
- Adam (Adaptive Moment Estimation): Mengadaptasi learning rate per parameter berbasis rata-rata momen pertama dan kedua.
- AdamW: Perbaikan Adam dengan memisahkan weight decay dari perhitungan gradien adaptif.
M3