Eval agent: golden, deteksi loop, validitas tool
A4 — Observability, Eval & Produksi
Eval RAG (M5) menguji jawaban; eval agent menguji jalur — tool mana dipilih, urutan, dan apakah sampai selesai.
Empat lapis evaluasi
- Golden path: N kasus nyata dengan "tool yang benar" diharapkan. Cek: jawaban sesuai? tool yang dipakai = yang diharapkan?
- Deteksi loop: monitor tool call berulang dengan argumen identik / langkah yang tidak menambah informasi — flag sebagai macet.
- Validitas tool: proporsi tool call yang (a) namanya ada, (b) argumen lolos schema, (c) sukses eksekusi. Validitas > 80% menandakan schema/deskripsi buruk (A1).
- Kualitas jawaban: golden answer matching / LLM-as-judge — sama seperti RAG M5.
Regresi tiap refactor
Prompt berubah, framework ganti, schema tool diedit — semuanya berisiko merusak jalur. Jalankan golden set sebelum & sesudah; simpan hasil run ke file agar bisa dibandingkan.
Metrik sederhana yang bisa ditiru
sukses_rate= run yang menghasilkan jawaban final dalam batas steps ÷ total run.avg_steps,avg_tokens,avg_latency.tool_validity,loop_detected_count.
Tugas: tulis 6 kasus golden untuk agenmu (2 sukses mudah, 2 butuh 2+ tool, 2 sengaja menyalahgunakan tool/path traversal). Jalankan dan catat: sukses_rate, avg_steps, tool_validity.
A4