Capstone: agen produksi mini di agent-lab
A4 — Observability, Eval & Produksi
Tutup course: satukan A1–A4 jadi satu agen agen-produksi/ di agent-lab — layak didemokan, bukan toy.
Yang dibangun
- 2–3 tools bermakna (mis. baca/riset lokal dari A1 + memory dari A2 + 1 server MCP dari A3).
- Loop dengan MAX_STEPS, budget, guardrail allowlist + timeout (A1, A4).
- Memory lintas sesi (A2) + tracing JSONL tiap langkah (A4).
- Golden eval: 6 kasus (A4-eval) — skrip
eval.py/eval.tsyang mencetak sukses_rate, avg_steps, tool_validity. - README: arsitektur (diagram), cara run, hasil eval terbaru, keputusan framework (A0) + 1 hal yang kamu ubah setelah melihat trace.
Kriteria selesai
- Capstone menyelesaikan satu tugas nyata lintas sesi (mulai kemarin, selesai hari ini dengan memory).
- Eval script jalan tanpa API key ekstra dan mencetak 4 metrik.
- Trace satu sesi tersimpan dan bisa dibaca.
- README lengkap — ini portofoliomu: orang harus bisa run dan memahami dari dokumen saja.
Langkah pengerjaan
- Pilih + integrasi 2-3 tool (memori, MCP, baca lokal)
- Guardrail: allowlist, timeout, budget max steps
- Tracing JSONL per langkah
- Script eval 6 kasus golden + 4 metrik
- Uji lintas sesi end-to-end
- README: arsitektur, cara run, hasil eval, 1 pelajaran dari trace
A4