Guardrail: batas keras sebelum agent menyentuh dunia nyata
A4 — Observability, Eval & Produksi
Tool memberimu efek dunia nyata — artinya agentmu bisa melakukan hal mahal/berbahaya. Guardrail bukan fitur bonus, ini syarat produksi.
Empat guardrail wajib
- Allowlist tools — agent hanya boleh memanggil tool yang terdaftar; server MCP publik dinilai satu per satu sebelum didaftarkan.
- Sandbox eksekusi — tool yang menjalankan perintah/akses file berjalan di direktori terbatas (guard path, buang privilege), timeout per tool, batas ukuran output.
- Prompt injection — konten dari luar (hasil web, dokumen user, output tool) jangan pernah dipercaya sebagai instruksi: prompt sistem tegas + konten tool dikurung dalam blok data eksplisit; tool yang mengeksekusi (web) tidak boleh menerima argumen yang berasal langsung dari konten eksternal tanpa validasi.
- Budget & rate limit — max steps, max token per sesi, ambang biaya, cooldown per tool mahal (mis. web search).
Mental model
Agent = kode yang kamu tulis + model yang kamu tidak kontrol penuh. Semua keputusan berisiko (write, delete, send, spend) harus melewati guardrail kode: validasi, konfirmasi user untuk aksi destruktif, audit log.
Tugas: daftarkan 3 aksi berisiko di agenmu (mis. tulis file, hapus, panggil API berbayar) dan desain guardrail masing-masing: validasi apa, perlu konfirmasi user atau tidak, dan apa yang masuk audit log.
A4