Lección 12: Cuantización — INT8/FP8
FP16 redujo la memoria a la mitad. La cuantización va más allá: representar los pesos y las activaciones como enteros de 8 bits (INT8) — un byte en vez de cuatro, 4 veces más pequeño y rápido en unidades INT. El costo: un pequeño error de redondeo. El secreto para mantener la precisión es la calibra
La cuantización es como redondear precios a dólares enteros en vez de centavos. Ahorras espacio y calculas rápido, y el resultado final suele ser casi idéntico — siempre que elijas el 'redondeo' correcto (scale).
- Cuantización INT8
- Representar valores como enteros de 8 bits (un byte) en vez de FP32 (4 bytes). 4 veces más pequeño y rápido, a costa de la precisión.
- Escala
- Un factor que mapea el rango de FP32 al rango de enteros. q = round(x / scale); dequantización: x ≈ q * scale.
- Calibración
- Ejecutar datos representativos para medir el rango real de valores y elegir una escala que minimice el error de redondeo.