Project: micro-GPT — forward pass + training loop
P1 — LLM Sederhana
Turunan praktis dari "Let's build GPT" (m4-transformer): transformer mini yang benar-benar kamu ketik sendiri — bukan copy-paste.
Yang dibangun
- Blok transformer: embedding, positional, 2 blok attention multi-head, FFN, layernorm.
- Training loop di korpora kecil: cross-entropy, AdamW, learning rate sederhana.
- Generator: sampling dari logits dengan temperature + top-k.
Kriteria selesai
- Loss turun terukur (log ke file).
- Sampling menghasilkan teks yang mengikuti distribusi data latih.
- Kamu bisa menjelaskan peran tiap komponen (QKV, mask, layernorm) tanpa catatan — siap uji jelaskan di lesson p1-uji-jelaskan.
Langkah pengerjaan
- Setup tensor ops (numpy/torch) + tokenizer byte-level
- Implementasi attention + feed-forward + layernorm
- Training loop + logging loss
- Generator: temperature + top-k sampling
- README: diagram alur forward + grafik loss
P1