Lección 10: Batching dinámico y serving — Agrupar solicitudes en tiempo real
En producción, las solicitudes no llegan en un batch ordenado — van goteando una por una desde distintos usuarios. Si ejecutas cada una por separado, el throughput se derrumba. La solución en servidores de inferencia como Triton: el batching dinámico — esperar una ventana diminuta, acumular las soli
Un ascensor que sale de inmediato con un solo pasajero desperdicia viajes. El batching dinámico es esperar unos segundos a que entre más gente — no demasiado, para que nadie se moleste — y después subir con el ascensor lleno.
- Batching dinámico
- El servidor agrupa solicitudes separadas que llegan dentro de una ventana corta en un solo batch, hasta un límite de tamaño o de tiempo.
- Demora máxima de cola
- Cuánto tiempo está dispuesto a esperar el servidor para acumular un batch antes de ejecutarlo. Ajusta el equilibrio entre latencia y throughput.
- Instancias del modelo
- Varias copias del modelo que se ejecutan en paralelo en la misma GPU para atender solicitudes de forma concurrente.