Token, cost & latency observability
M10 — AI Engineering di Production
Membangun dashboard observabilitas sistem LLM menggunakan OpenTelemetry, OpenInference, dan platform tracing seperti Langfuse.
Metrik Kunci yang Wajib Dipantau:
- TTFT (Time To First Token): Waktu dari request dikirim sampai token pertama muncul di layar user.
- TPOT (Time Per Output Token): Kecepatan streaming token berikutnya (mengukur fluiditas membaca).
- Tokens/Sec Throughput: Kapasitas pemrosesan total GPU server.
- Cost Tracking: Estimasi pengeluaran token per sesi pengguna.
M10