Lição 14: Projeto Final de Benchmark — Juntando Tudo
Chegou a hora de conectar tudo. Nesta aula vamos construir um benchmark real no estilo NVIDIA: varrer tamanhos de batch e precision, medir corretamente (warmup + synchronize), e reportar throughput e p99 para cada configuração — e então escolher a configuração que atende ao orçamento de latência e s
Um benchmark é como testar um carro em cada marcha antes de declarar 'ele é rápido': você mede cada configuração sob as mesmas condições, regista os números, e escolhe a marcha que se encaixa na sua estrada.
- Benchmark sweep
- Medir sistematicamente o desempenho em várias configurações (batch, precision) sob as mesmas condições, para escolher a melhor.
- Latency budget
- A latência máxima que uma requisição pode levar (por exemplo, p99 < 50ms). Você escolhe o maior batch que ainda atende a isso.
- Triton Inference Server
- O servidor de inferência da NVIDIA, que roda modelos de vários frameworks com dynamic batching, concurrency e métricas embutidas.