Fundamentos de escalado: Latencia, Throughput, SLOs
En esta lección aprendemos a estimar, en números, qué tan 'grande' necesita ser un sistema. Vamos a practicar estimaciones de capacidad (cuánta carga debe manejar el sistema), QPS (queries per second: cuántas solicitudes llegan cada segundo). Calcularemos cuánto almacenamiento se necesita y cuánto a
El System Design es como planear una ciudad entera: calles que llevan el tráfico, bodegas que guardan cosas, semáforos que mantienen el flujo en orden, y equipos de mantenimiento que arreglan problemas, todo para que la ciudad siga funcionando bien incluso en hora pico, cuando todos salen a la vez.
- Capacidad y SLO
- La habilidad central de esta lección: estimar en números el tamaño del sistema —capacidad (cuánta carga maneja), QPS (solicitudes por segundo), cuánto almacenamiento se necesita, cuánto ancho de banda (bandwidth: la cantidad de datos que fluyen), y SLOs (service level objectives, nuestra promesa sobre disponibilidad o velocidad). Un cálculo aproximado hecho de antemano que te ayuda a planear correctamente.
- Trade-off
- Una elección consciente entre dos opciones, donde cada una tiene una ventaja pero también un costo. No hay una respuesta perfecta: eliges lo que se ajusta y le explicas al entrevistador qué ganas y qué sacrificas. Como elegir entre una ruta rápida y cara, y una barata y lenta.
- Métrica operativa
- Un número que puedes medir para saber si una decisión realmente funciona una vez que el sistema está en vivo y atendiendo usuarios reales (producción). Por ejemplo: latency (cuánto tarda en llegar una respuesta), error rate (la proporción de solicitudes que fallan), queue lag (cuántas tareas están esperando en fila), cache hit ratio (con qué frecuencia encontramos la respuesta lista en un almacén temporal rápido), y más.