Lección 0: ¿Por qué entender el sistema y la red?
Tu sitio web funciona perfecto en tu laptop — y de repente los usuarios reportan que no pueden acceder para nada. No hay ningún mensaje de error en el código, ningún stack trace que revisar. Esto no es un bug en una función que escribiste — es una falla en la capa debajo del código: cómo el sistema
Cuando algo se rompe en un servidor, el código por sí solo no te dice por qué — hay que mirar debajo del capó, al sistema y a la red.
- Incidente de producción (Production incident)
- Un evento en el que un servicio en producción deja de funcionar o se vuelve lento para usuarios reales — no solo una falla en un entorno de desarrollo.
- Causa raíz (Root cause)
- La razón real por la que ocurrió una falla, a diferencia del síntoma externo que se nota primero.
- Funcionamiento interno del sistema operativo (OS internals)
- Cómo el kernel gestiona los procesos, la memoria y los archivos por debajo de cada programa que se ejecuta en la máquina.
- Accesibilidad de red (Network reachability)
- Si una máquina puede siquiera alcanzar a otra a través de la red, incluso antes de hablar de qué se ejecuta en ella.
- Depuración a nivel de sistema (Systems-level debugging)
- Diagnosticar fallas usando herramientas que revelan lo que realmente ocurre en el kernel y en la red, no solo en el código de la aplicación.