Lección 6: Latencia vs. throughput — Dos métricas, dos objetivos
Un ingeniero dice 'el modelo es rápido'. La primera pregunta en NVIDIA: ¿rápido en qué sentido? ¿Latencia (qué tan rápido vuelve una respuesta) o throughput (cuántas respuestas por segundo)? Son dos objetivos distintos que a veces chocan entre sí — y tienes que saber a cuál apuntas antes de tocar el
La latencia es cuánto tarda en llegarte el plato desde la cocina. El throughput es cuántos platos saca la cocina por hora. Puedes cocinar muchos platos juntos (throughput alto) pero entonces cada plato individual espera un poco más (latencia más alta).
- Latencia
- El tiempo que tarda en volver una sola solicitud — desde la entrada hasta la salida. Se mide en milisegundos. Crítico para la experiencia de usuario en tiempo real.
- Throughput
- Cuántos elementos/solicitudes se procesan por segundo. Se mide en elementos/seg. Crítico para el procesamiento masivo y el costo.