Средний p99 по десяти подам 180 мс, а пользователи жалуются на секундные ответы
Сервис отдаёт метрику-summary с готовыми квантилями, панель SLO построена так:
avg(http_request_duration_seconds{quantile="0.99"})
Панель показывает 180 мс при цели 300 мс. При этом один из десяти подов застрял на медленной ноде, принимает четверть трафика и отвечает за 1–2 секунды.
Как считать p99 по сервису правильно?
- Перейти на histogram и считать по сумме корзин
- Взвесить p99 подов по их доле трафика
- Брать медиану из p99 подов вместо среднего
- Усреднять p99 подов за час, а не мгновенно
