Project: Finetune Mini + LLM-judge
M9 — Fine-tuning & Alignment
Lakukan fine-tuning model terbuka kecil (mis. LLaMA-3-8B atau Qwen-2.5-3B) menggunakan QLoRA pada dataset domain spesifik, lalu evaluasi peningkatannya menggunakan LLM-as-a-judge.
Yang Dibangun
- Pipeline dataset curation dan script training QLoRA.
- Skrip evaluasi komparasi blind A/B test dinilai oleh model evaluator.
Langkah pengerjaan
- Siapkan 500 sampel dataset format instruksi berkualitas tinggi
- Jalankan fine-tuning QLoRA menggunakan Unsloth atau HuggingFace SFTTrainer
- Simpan dan gabungkan adapter LoRA dengan base model
- Buat script LLM-as-a-judge dengan rubrik evaluasi yang ketat
- Bandingkan win-rate model dasar vs model fine-tuned dalam laporan final
M9