Lição 12: Quantization — INT8/FP8
O FP16 reduziu a memória pela metade. A quantization vai mais longe: representa pesos e ativações como inteiros de 8 bits (INT8) — um byte em vez de quatro, 4x menor e rápido em unidades INT. O custo: um pequeno erro de arredondamento. O segredo para manter a precisão é a calibration. Nesta aula vam
Quantization é como arredondar preços para reais inteiros em vez de centavos. Você economiza espaço e calcula rápido, e o resultado final geralmente fica quase idêntico — desde que você escolha o 'arredondamento' (scale) certo.
- INT8 quantization
- Representar valores como inteiros de 8 bits (um byte) em vez de FP32 (4 bytes). 4x menor e mais rápido, a um custo de precisão.
- Scale
- Um fator que mapeia o alcance do FP32 para o alcance de inteiros. q = round(x / scale); dequantize: x ≈ q * scale.
- Calibration
- Rodar dados representativos para medir o alcance real de valores e escolher um scale que minimize o erro de arredondamento.