Среднее время ответа 120 мс, а пользователи жалуются на тормоза
На дашборде сервиса единственная метрика латентности — среднее время ответа, и оно стабильно держится около 120 мс. При этом поддержка получает регулярные жалобы: «страница заказов иногда грузится по десять секунд».
Как объяснить расхождение и что добавить в мониторинг?
- Среднее скрывает хвост распределения: редкие очень медленные ответы почти не влияют на него; нужны перцентили p95/p99 в разрезе эндпоинтов
- Скорее всего, дело в клиентской сети: серверные метрики в порядке, значит проблема на стороне пользователя, а не бэкенда
- Метрика собирается неверно: среднее нужно считать не по всем запросам, а только по успешным — тогда всплески станут видны
- Нужно уменьшить интервал сбора метрик: при более частых замерах среднее покажет реальные пики
