Урок 0: Зачем вообще понимать систему и сеть?
Ваш сайт прекрасно работает на вашем ноутбуке — а затем пользователи сообщают, что он совершенно недоступен. В коде нет сообщения об ошибке, нет stack trace, на который можно было бы взглянуть. Это не ошибка в написанной вами функции — это сбой на уровне под кодом: в том, как система запускает ваш с
Когда что-то ломается на сервере, один лишь код не скажет вам почему — нужно заглянуть под капот, на систему и сеть.
- Инцидент в production (production incident)
- Событие, при котором работающий сервис перестаёт работать или замедляется для реальных пользователей — а не просто сбой в среде разработки.
- Первопричина (root cause)
- Настоящая причина, по которой произошёл сбой, в отличие от внешнего симптома, который вы замечаете первым.
- Внутреннее устройство ОС (OS internals)
- То, как ядро управляет процессами, памятью и файлами под каждой программой, работающей на машине.
- Сетевая достижимость (network reachability)
- Вопрос о том, может ли одна машина вообще достичь другой по сети, ещё до обсуждения того, что на ней запущено.
- Отладка на уровне системы (systems-level debugging)
- Диагностика сбоев с помощью инструментов, которые показывают, что на самом деле происходит в ядре и сети, а не только в коде приложения.