Вступить в клуб →
лёгкаявопросМониторинг и алертинг: Prometheus, Grafana, SLO

Сервис лежал 40 минут, а алерт на долю ошибок молчал

Единственный алерт сервиса orders:

sum(rate(http_requests_total{job="orders", code=~"5.."}[5m]))
  / sum(rate(http_requests_total{job="orders"}[5m])) > 0.05

После неудачного обновления NetworkPolicy Prometheus перестал достукиваться до подов, а заодно и ingress-контроллер. Пользователи 40 минут получали ошибки, алерт не пришёл.

Чего не хватает?

  • Алерта на `up{job="orders"} == 0`
  • Порога доли ошибок 1% вместо 5%
  • Окна `[30m]` вместо `[5m]` в запросе
  • Панели с долей ошибок в Grafana

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела