DPO: alignment tanpa reward model
M9 — Fine-tuning & Alignment
Direct Preference Optimization (DPO)
Tradisional Alignment (RLHF / Reinforcement Learning from Human Feedback) membutuhkan pelatihan model reward terpisah yang rumit dan tidak stabil.
Inovasi DPO (Rafailov et al., 2023)
DPO membuktikan secara matematis bahwa kita dapat mengoptimalkan preferensi manusia secara langsung pada model kebijakan (policy) menggunakan dataset pasangan respons yang disukai () dan tidak disukai ():
Jauh lebih stabil, cepat, dan mudah di-train daripada PPO. DPO sering lebih sederhana secara engineering daripada pipeline RLHF berbasis PPO, tetapi kualitas dan stabilitas training tetap bergantung pada dataset, model, hyperparameter, dan setup evaluasi.
M9