Leçon 11 : Précision — FP32 → FP16/BF16 et Tensor Cores
Ton modèle est stocké en FP32 — 4 octets par nombre. Mais l'inférence n'a généralement pas besoin de toute cette précision. Passer en FP16 ou BF16 divise la mémoire par deux et active les Tensor Cores — des unités matérielles dédiées qui multiplient les matrices en basse précision beaucoup plus vite
FP32, c'est écrire chaque nombre avec des tonnes de chiffres après la virgule. L'inférence a généralement besoin de moins de chiffres (FP16) — moitié moins de place, et le GPU les multiplie bien plus vite grâce à du matériel dédié.
- FP16 / BF16
- Formats sur 16 bits (2 octets) au lieu de FP32 (4 octets). Ils divisent la mémoire par deux et accélèrent. BF16 garde le même intervalle d'exposant que FP32.
- Tensor Cores
- Unités matérielles des GPU NVIDIA pour la multiplication-accumulation de matrices en basse précision (FP16/BF16/INT8) — bien plus rapides que FP32.
- autocast (mixed precision)
- Exécute les opérations lourdes en FP16 et garde les opérations sensibles en FP32 — vitesse avec stabilité.