Lección 14: El proyecto final de benchmark — Uniendo todo
Es hora de conectar todo. En esta lección construimos un benchmark real al estilo de NVIDIA: recorremos tamaños de batch y precisiones, medimos correctamente (warmup + synchronize), y reportamos el throughput y el p99 para cada configuración — y después elegimos la configuración que cumple el presup
Un benchmark es como probar un auto en cada marcha antes de declarar 'es rápido': mides cada configuración bajo las mismas condiciones, anotas los números, y eliges la marcha que se ajusta a tu camino.
- Barrido de benchmark
- Medir sistemáticamente el rendimiento en varias configuraciones (batch, precisión) bajo las mismas condiciones, para elegir la mejor.
- Presupuesto de latencia
- La latencia máxima que puede tomar una solicitud (por ejemplo, p99 < 50ms). Eliges el batch más grande que todavía lo cumpla.
- Triton Inference Server
- El servidor de inferencia de NVIDIA que ejecuta modelos de muchos frameworks con batching dinámico, concurrencia, y métricas integradas.