Сервис лежал 40 минут, а алерт на долю ошибок молчал
Единственный алерт сервиса orders:
sum(rate(http_requests_total{job="orders", code=~"5.."}[5m]))
/ sum(rate(http_requests_total{job="orders"}[5m])) > 0.05
После неудачного обновления NetworkPolicy Prometheus перестал достукиваться до подов, а заодно и ingress-контроллер. Пользователи 40 минут получали ошибки, алерт не пришёл.
Чего не хватает?
- Алерта на `up{job="orders"} == 0`
- Порога доли ошибок 1% вместо 5%
- Окна `[30m]` вместо `[5m]` в запросе
- Панели с долей ошибок в Grafana
