Project: Prompt Bench
M5 — Prompt Engineering
Bangun benchmark pengujian prompt otomatis untuk membandingkan 10 variasi prompt pada 5 tugas ekstraksi data berbeda, dilengkapi uji ketahanan terhadap prompt injection.
Yang Dibangun
- Skrip evaluasi otomatis yang memvalidasi output model terhadap skema JSON Zod/Pydantic.
- Laporan komparasi kuantitatif antara prompt Zero-shot, Few-shot, dan CoT.
Langkah pengerjaan
- Tentukan 5 tugas ekstraksi data dengan kriteria ground truth yang jelas
- Rancang 10 varian prompt (Zero-shot, Few-shot, CoT, Role-based)
- Implementasikan parser output dengan skema validasi JSON ketat
- Uji ketahanan prompt terhadap 3 skenario serangan prompt injection
- Kompilasi tabel skor akurasi dan kepatuhan format ke dalam laporan benchmark
M5