Leçon 12 : Quantization — INT8/FP8
FP16 a divisé la mémoire par deux. La quantization va plus loin : représenter poids et activations comme des entiers 8 bits (INT8) — un octet au lieu de quatre, 4x plus petit et plus rapide sur les unités INT. Le prix : une petite erreur d'arrondi. Le secret pour préserver la précision, c'est la cal
La quantization, c'est comme arrondir des prix à l'euro près plutôt qu'au centime. On économise de la place et on calcule vite, et le résultat final est généralement presque identique — à condition de bien choisir l'« arrondi » (le scale).
- INT8 quantization
- Représenter des valeurs comme des entiers 8 bits (un octet) au lieu de FP32 (4 octets). 4x plus petit et plus rapide, au prix de la précision.
- Scale
- Un facteur qui fait correspondre l'intervalle FP32 à l'intervalle des entiers. q = round(x / scale) ; déquantization : x ≈ q * scale.
- Calibration
- Faire tourner des données représentatives pour mesurer l'intervalle réel des valeurs et choisir un scale qui minimise l'erreur d'arrondi.