Lección 11: Precisión — FP32 → FP16/BF16 y Tensor Cores
Tu modelo está almacenado en FP32 — 4 bytes por número. Pero la inferencia normalmente no necesita toda esa precisión. Pasar a FP16 o BF16 reduce la memoria a la mitad y activa los Tensor Cores — unidades de hardware dedicadas que multiplican matrices en baja precisión mucho más rápido. En esta lecc
FP32 es escribir cada número con un montón de dígitos después de la coma. La inferencia normalmente necesita menos dígitos (FP16) — la mitad del espacio, y la GPU los multiplica mucho más rápido con hardware dedicado.
- FP16 / BF16
- Formatos de 16 bits (2 bytes) en lugar de FP32 (4 bytes). Reducen la memoria a la mitad y aceleran. BF16 conserva el rango de exponente de FP32.
- Tensor Cores
- Unidades de hardware en las GPUs de NVIDIA para la multiplicación-acumulación de matrices en baja precisión (FP16/BF16/INT8) — mucho más rápidas que FP32.
- autocast (precisión mixta)
- Ejecuta las operaciones pesadas en FP16 y mantiene las operaciones sensibles en FP32 — velocidad con estabilidad.