LoRA & QLoRA (paper)
M9 — Fine-tuning & Alignment
Paper Hu et al. (Microsoft, 2021) dan Dettmers et al. (2023) yang merevolusi efisiensi fine-tuning model LLM skala besar.
1. LoRA (Low-Rank Adaptation)
Alih-alih memperbarui semua bobot matriks model yang sangat mahal, LoRA membekukan (freeze) bobot asli dan hanya melatih dekomposisi matriks ber-rank rendah:
di mana dan dengan rank (misal atau ).
2. QLoRA (Quantized LoRA)
Melakukan kuantisasi bobot model dasar ke presisi 4-bit NormalFloat (NF4) sambil tetap melatih adapter LoRA pada presisi 16-bit. Memungkinkan fine-tuning model 70B parameter pada satu GPU komersial 24GB VRAM!
M9