Project: LLM judge vs aturan
P4 — Kualitas & Biaya
Menilai jawaban "benar" itu subjektif — uji dua cara dan bandingkan kesepakatannya.
Yang dibangun
- Judger aturan: cek kata kunci + validasi [N] ada di golden set.
- LLM judge: model lain menilai relevansi (1–5) dengan rubrik.
- Ukur kesepakatan (agreement %) di 10 QA yang sama.
Kriteria selesai
- Kedua judger mencetak skor untuk 10 QA yang sama.
- Agreement dihitung + minimal 1 kasus divergensi dijelaskan.
Langkah pengerjaan
- Judger aturan (keyword + validasi citation)
- LLM judge dengan rubrik skor
- Bandingkan 10 QA + hitung agreement
- Dokumentasikan 1 kasus divergensi
P4