Project: n-gram language model
P1 — LLM Sederhana
Model bahasa paling sederhana yang masih berguna: probabilitas token berikutnya dari konteks n-1 token. Ini titik awal memahami "apa yang sebenarnya dipelajari LLM".
Yang dibangun
- Korpora kecil (kumpulkan 1–2 MB teks: Wikipedia bahasa Indonesia / subtitle).
- Tokenisasi kata sederhana; bangun tabel hitung n-gram (n=2,3,4) dengan smoothing.
- Sampling: mulai dari token awal, pilih token berikutnya sesuai distribusi (dengan temperature).
Kriteria selesai
- Sampling menghasilkan kalimat yang strukturnya masuk akal (subjek-predikat).
- Fungsi
berikutnya(konteks, n, temperature)bisa dijelaskan dari kode, bukan dari hafalan teori. - Catatan di README: kelemahan n-gram vs neural LM (baca lesson m3-neuron).
Langkah pengerjaan
- Kumpulkan 1–2 MB korpora + tokenizer sederhana
- Hitung n-gram (n=2..4) dengan smoothing
- Sampling dengan temperature dari seed token
- README: contoh output + kelemahan vs neural LM
P1