Attention Is All You Need (paper)
M4 — Large Language Models
Paper revolusioner dari Vaswani et al. (2017) yang memperkenalkan arsitektur Transformer dan mekanisme Self-Attention.
Mental Model: Query, Key, Value (Q, K, V)
Attention memungkinkan setiap token dalam kalimat melihat dan menyerap informasi dari token-token lain dalam context.
- Query (): "Informasi apa yang sedang kucari?"
- Key (): "Karakteristik/label informasi apa yang kumiliki?"
- Value (): "Isi informasi nyata yang bisa kubagikan."
Formula Scaled Dot-Product Attention
- : Menghitung skor kecocokan / relevansi antar setiap pasang token di seluruh kalimat.
- : Scaling factor untuk menjaga skala nilai dot product tetap lebih stabil ketika dimensi key bertambah.
Multi-Head Attention
Memproyeksikan ke beberapa ruang representasi paralel (heads) sehingga model dapat memperhatikan hubungan sintaksis, semantik, dan posisi secara bersamaan.
M4