Evaluasi RAG dengan RAGAS
M7 — Retrieval-Augmented Generation
Mengukur Kualitas Sistem RAG Secara Kuantitatif
Tanpa evaluasi otomatis, perubahan pada ukuran chunking atau prompt dapat merusak akurasi tanpa disadari.
4 Metrik Inti RAGAS
- Faithfulness (Grounding): Apakah semua klaim pada jawaban didukung oleh chunk konteks yang diambil? (Mencegah halusinasi).
- Answer Relevance: Seberapa tepat jawaban menjawab pertanyaan asli user tanpa bertele-tele.
- Context Precision: Apakah chunk yang relevan berada di peringkat atas daftar retrieval?
- Context Recall: Apakah konteks yang diambil memuat seluruh informasi yang dibutuhkan untuk menjawab ground truth?
M7