Project: mini-GPT lokal
M4 — Large Language Models
Bangun dan latih arsitektur decoder-only Transformer mini (nanoGPT style) pada dataset teks kecil secara lokal di PyTorch.
Yang Dibangun
- Multi-Head Causal Self-Attention block dan Feed-Forward Network ().
- Autoregressive generation loop dengan kontrol sampling Temperature dan Top-p.
Langkah pengerjaan
- Implementasikan Positional Embedding dan Causal Self-Attention di PyTorch
- Susun Transformer Block lengkap (LayerNorm + Attention + Residual + FFN)
- Latih mini-GPT pada dataset Tiny Shakespeare hingga loss konvergen
- Buat fungsi generate autoregressive token-by-token
- Bandingkan hasil teks pada variasi temperature 0.2, 0.7, dan 1.2 di README
M4