Let's build GPT dari nol
M4 — Large Language Models
Andrej Karpathy membangun model GPT dari nol dalam 2 jam: tokenisasi → embedding → blok transformer → training loop → autoregressive sampling.
Setelah menonton, kamu seharusnya bisa menjelaskan:
- Mengapa Causal Attention Masking wajib pada decoder-only LLM agar token tidak dapat "melihat masa depan".
- Peran Residual Connections dan LayerNorm sebelum blok Attention dan FFN.
- Bagaimana cross-entropy loss dihitung atas logits prediksi token berikutnya.
M4