Этот трек отвечает на вопрос, который отделяет инженера эксплуатации от «человека, который перезапускает сервисы»: откуда ты знаешь, что система работает, и как узнаёшь об этом раньше пользователей. Здесь нет отдельной темы «поставить Prometheus»: инструменты меняются, а модель — три сигнала, цель по надёжности, бюджет ошибок, работа в инциденте — остаётся одинаковой в любой компании. Трек одинаково полезен тем, у кого мониторинга почти нет, и тем, у кого стоят все системы, но дежурный за ночь получает сорок сообщений и ни одно из них не помогает.
Linux (Linux вглубь: процессы, стандартные потоки, сигналы), сети (Сети с нуля: HTTP, коды ответов, задержки), контейнеры (Docker: где живут журналы, потоки вывода) и доставка (CI/CD: выкаты, откаты, метрики DORA). Полезен Kubernetes — большинство примеров про сбор данных в кластере — и Bash/Python: все мини-лабы трека выполняются оболочкой и небольшими скриптами.
Структура трека
Лучшая литература к треку
- Site Reliability Engineering и The Site Reliability Workbook (Google, доступны бесплатно) — первоисточник по целям надёжности, бюджету ошибок, многооконным правилам по скорости сжигания, дежурству и разборам без обвинений.
- Документация Prometheus — модель данных, типы показателей, функции запросов и правила оповещений; читается как учебник по метрикам вообще.
- Документация OpenTelemetry и спецификация W3C Trace Context — стандарт сбора данных наблюдения и формат передачи контекста между сервисами.
- NIST SP 800-61 — жизненный цикл реагирования на инциденты: четыре фазы, из которых выросли все отраслевые схемы.
- Observability Engineering (Majors, Fong-Jones, Miranda, O’Reilly) — про широкие события с высокой детализацией и про то, чем наблюдаемость отличается от набора дашбордов.
Ничего устанавливать не обязательно: каждая мини-лаба имеет офлайн-часть на оболочке и Python — сырые журналы, расчёт квантилей по корзинам, скорость сжигания, поведение правил с двумя окнами, настольная тренировка по ролям. Где полезно увидеть настоящий инструмент, дана необязательная часть с Docker (Prometheus, система трассировки) — она не нужна для понимания. Главная привычка трека: прежде чем добавлять график, сформулируй вопрос, на который он отвечает. Уроки 6–7 стоит проходить с калькулятором: там всё держится на арифметике долей и минут.