Data pipeline & split train-valid-test
M2 — Machine Learning Engineering
Membangun Data Pipeline yang Bersih
Kegagalan model di production sering kali bukan karena algoritma, melainkan kecacatan pipeline data.
1. Pemisahan Dataset (Train / Valid / Test)
- Train Set (70–80%): Digunakan model untuk mempelajari bobot.
- Validation Set (10–15%): Digunakan untuk tuning hyperparameter dan early stopping.
- Test Set (10–15%): Disimpan murni untuk evaluasi performa final, tidak boleh disentuh saat training.
2. Bahaya Data Leakage
Data leakage terjadi ketika informasi dari masa depan / data uji bocor ke data latih (misalnya melakukan scaling/imputasi pada seluruh dataset sebelum pemisahan train/test).
3. Feature Engineering & Scaling
- StandardScaler: Transformasi data menjadi mean 0 dan varians 1 ().
- One-Hot Encoding vs Target Encoding untuk variabel kategorikal.
M2