Speculative Decoding: Mempercepat Generasi Tanpa Mengubah Model
I4 — Advanced Optimization: Quantization, Speculative Decoding & Production LLMOps
Trik Cerdas: Menebak Token dengan Model Draf
1. Inti Permasalahan
Menghasilkan 1 token dari model 70B membutuhkan pembacaan bobot 70B secara utuh dari VRAM. Ini sangat lambat dan boros bandwidth.
2. Cara Kerja Speculative Decoding
1. Draft Model (1B - Super Cepat):
Menebak 5 token ke depan secara spekulatif: ["AI", "is", "transforming", "the", "world"]
2. Target Model (70B - Model Utama):
Memverifikasi KELIMA token tebakan sekaligus dalam SATU forward pass paralel tunggal!
3. Hasil Verifikasi:
Token 1-4 Diterima (Valid) ✓
Token 5 Ditolak ✗ (Diganti dengan prediksi model 70B yang benar)
3. Mengapa Menghasilkan Output 100% Identik?
Target model memvalidasi distribusi probabilitas tebakan menggunakan rejection sampling matematis. Jika tebakan lolos, probabilitas teksnya 100% identik secara matematis dengan jika model 70B menghasilkan token tersebut dari awal!
Hasil Nyata di Lapangan: Akselerasi kecepatan generasi 2x hingga 3x lipat dengan kualitas jawaban yang sama persis!
I4