Вступить в клуб →
средняявопросМониторинг и алертинг: Prometheus, Grafana, SLO

Тридцать алертов за ночь, а падение оплаты никто не заметил

На 40 серверах настроены алерты «CPU > 80%», «память > 85%», «iowait > 20%» с отправкой звонком. Дежурный получает около 30 вызовов за ночь, почти все проходят сами. В прошлую пятницу оплата 25 минут отвечала ошибкой 500 из-за истёкшего токена платёжного шлюза — ресурсы были в норме, и ни один алерт не сработал.

Как перестроить алертинг?

  • Будить по симптомам: ошибкам и задержкам у пользователей
  • Поднять пороги всех ресурсных алертов до 95%
  • Слать ресурсные алерты в чат, звонить только ночью
  • Добавить алерты на каждый процесс на серверах

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела