Мониторинг/логирование: стартовая конфигурация

Мониторинг и логирование для новичка в DevOps: стартовая конфигурация, метрики, алерты и сбор логов. Что настроить в первую очередь, зачем и какими инструментами.

Автор — Дмитрий Тыльный, Senior DevOps · 9 июня 2026 · 9 мин
Мониторинг/логирование: стартовая конфигурация

Коротко. Мониторинг отвечает на вопрос «что происходит с системой прямо сейчас» (метрики), логирование — «что именно случилось и почему» (события). Базовый стек новичка: Prometheus + Grafana для метрик и централизованный сбор логов. Плюс алерты, чтобы узнавать о проблеме раньше пользователей.

Зачем это нужно

Без наблюдаемости вы узнаёте о падении от разгневанных пользователей. Мониторинг и логи дают: раннее обнаружение проблем, быструю диагностику причины и данные для оптимизации. Это часть культуры надёжности (SRE).

Мониторинг и метрики

Метрика — числовой показатель во времени (загрузка CPU, память, число запросов, задержка). Классика «золотых сигналов»:

  • Latency — время ответа.
  • Traffic — нагрузка (запросы в секунду).
  • Errors — доля ошибок.
  • Saturation — насыщенность ресурсов (CPU, память, диск).

Инструменты: Prometheus собирает метрики, Grafana строит дашборды.

Логирование

  • ✅ Пишите структурированные логи (JSON), а не сплошной текст — их проще искать.
  • ✅ Указывайте уровень: DEBUG, INFO, WARN, ERROR.
  • ✅ Централизуйте сбор (например, стек Loki/ELK), чтобы искать по всем сервисам сразу.
  • ❌ Не логируйте секреты и персональные данные.

Алерты

Алерт — автоматическое уведомление, когда метрика вышла за порог (например, ошибки больше 5% или диск заполнен на 90%). Правила:

  • Алертить на симптомы (пользователю плохо), а не на каждую мелочь.
  • Меньше шума — иначе на алерты перестают реагировать.
  • Каждый алерт должен требовать действия.

Частые вопросы

С чего начать новичку?
Поднимите Prometheus + Grafana для одного сервиса и сделайте дашборд с CPU, памятью и числом запросов. Этого достаточно для понимания.

Чем метрики отличаются от логов?
Метрики — агрегированные числа во времени (тренды), логи — детальные записи событий (разбор конкретного случая). Нужны оба.

Нужно ли это джуну DevOps?
Базово — да. Понимание «золотых сигналов» и умение читать дашборд ждут даже на входе.

Полезно? Подпишитесь на Telegram

Вступить в канал