Вступить в клуб →
лёгкаявопросМониторинг и алертинг: Prometheus, Grafana, SLO

Алерт на загрузку CPU будит дежурного каждую ночь в 03:00

- alert: HostHighCpu
  expr: instance:cpu_usage:ratio > 0.9
  labels:
    severity: page

В 03:00 cron запускает бэкап, и CPU на 1–2 минуты поднимается до 95%. Алерт срабатывает и сразу гаснет. Настоящие перегрузки, ради которых алерт делали, длятся десятки минут.

Как поправить правило?

  • Добавить `for: 15m` к правилу
  • Поднять порог в expr до 0.99
  • Увеличить evaluation_interval до 5m
  • Сменить severity на warning

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела