Mixture-of-Experts (MoE) & Expert Parallelism (EP)
I3 — Distributed Serving & Parallelism Strategies
Melayani Model Sparse Mixture-of-Experts (MoE)
Model seperti Mixtral 8x7B atau DeepSeek-V3 memiliki total parameter raksasa (misal ratusan Miliar parameter), tetapi hanya mengaktifkan sebagian kecil parameter (sparse activation) untuk setiap token.
1. Cara Kerja Layer MoE
- Mengganti layer Feed-Forward Network (FFN) tunggal dengan kumpulan buah Experts independen (misal 8 atau 64 expert).
- Gating / Router Network: Memilih top- expert paling relevan (misal top-2 expert) untuk memproses token saat ini.
2. Expert Parallelism (EP)
- Setiap GPU menyimpan himpunan expert yang berbeda (misal GPU 0 menyimpan Expert 1 & 2, GPU 1 menyimpan Expert 3 & 4).
- Komunikasi All-to-All: Token yang dihasilkan dialihkan (routed) ke GPU yang memegang expert terpilih, lalu hasilnya dikumpulkan kembali.
I3