Кому это нужно

Этот трек отвечает на вопрос, который отделяет инженера эксплуатации от «человека, который перезапускает сервисы»: откуда ты знаешь, что система работает, и как узнаёшь об этом раньше пользователей. Здесь нет отдельной темы «поставить Prometheus»: инструменты меняются, а модель — три сигнала, цель по надёжности, бюджет ошибок, работа в инциденте — остаётся одинаковой в любой компании. Трек одинаково полезен тем, у кого мониторинга почти нет, и тем, у кого стоят все системы, но дежурный за ночь получает сорок сообщений и ни одно из них не помогает.

Что нужно знать перед началом

Linux (Linux вглубь: процессы, стандартные потоки, сигналы), сети (Сети с нуля: HTTP, коды ответов, задержки), контейнеры (Docker: где живут журналы, потоки вывода) и доставка (CI/CD: выкаты, откаты, метрики DORA). Полезен Kubernetes — большинство примеров про сбор данных в кластере — и Bash/Python: все мини-лабы трека выполняются оболочкой и небольшими скриптами.

Структура трека

Лучшая литература к треку

Как проходить

Ничего устанавливать не обязательно: каждая мини-лаба имеет офлайн-часть на оболочке и Python — сырые журналы, расчёт квантилей по корзинам, скорость сжигания, поведение правил с двумя окнами, настольная тренировка по ролям. Где полезно увидеть настоящий инструмент, дана необязательная часть с Docker (Prometheus, система трассировки) — она не нужна для понимания. Главная привычка трека: прежде чем добавлять график, сформулируй вопрос, на который он отвечает. Уроки 6–7 стоит проходить с калькулятором: там всё держится на арифметике долей и минут.