Teknik Kuantisasi Modern: AWQ, GPTQ, SmoothQuant & FP8
I4 — Advanced Optimization: Quantization, Speculative Decoding & Production LLMOps
Mengompresi Bobot Model Tanpa Mengorbankan Kecerdasan
Kuantisasi adalah teknik memangkas presisi angka bobot model (misal dari 16-bit ke 4-bit atau 8-bit) untuk menghemat VRAM dan melipatgandakan kecepatan baca memori.
1. Perbandingan Algoritma Kuantisasi Utama
| Metode | Karakteristik Utama | Keunggulan Produksi |
|---|---|---|
| AWQ (Activation-aware Weight Quantization) | Memproteksi 1% bobot paling penting berdasarkan besaran aktivasi, mengkuantisasi 99% sisanya ke INT4. | Akurasi sangat tinggi, inferensi ultra-cepat di vLLM. |
| GPTQ | Menggunakan aproksimasi invers matriks Hessian per-lapisan secara one-shot. | Format sangat populer di HuggingFace, ukuran file model sangat kecil. |
| Native FP8 | Format floating-point 8-bit native yang didukung hardware Tensor Cores modern. | Bebas overhead konversi saat komputasi, akselerasi throughput 2x lipat. |
2. Dampak Kuantisasi terhadap Throughput
Karena fase decode LLM bersifat Memory-Bandwidth Bound, memangkas bobot model dari 16-bit (2 byte) ke 4-bit (0.5 byte) berarti volume data yang perlu ditransfer dari VRAM berkurang 4x lipat Kecepatan generasi token dapat meningkat hingga 2x–3x lipat!
I4