Lição 10: Dynamic Batching e Serving — Agrupando Requisições em Tempo Real
Em produção, as requisições não chegam num batch arrumadinho — elas pingam uma a uma, de utilizadores diferentes. Rodar cada uma sozinha faz o throughput desabar. A solução em servidores de inference como o Triton: dynamic batching — esperar uma pequena janela, acumular as requisições que chegaram,
Um elevador que sai na hora com um único passageiro desperdiça viagens. Dynamic batching é esperar alguns segundos para mais gente entrar — não tempo demais, para ninguém ficar irritado — e então subir com o elevador cheio.
- Dynamic batching
- O servidor agrupa requisições separadas que chegam dentro de uma janela curta num único batch, até um limite de tamanho ou de tempo.
- Atraso máximo da fila
- Quanto tempo o servidor está disposto a esperar para acumular um batch antes de rodar. Ajusta o equilíbrio entre latência e throughput.
- Instâncias do modelo
- Múltiplas cópias do modelo rodando em paralelo na mesma GPU para atender requisições de forma concorrente.