Средняя latency упала, клиенты жалуются
После оптимизации сетевого сервиса средняя latency снизилась с 12 мс до 7 мс. Через неделю приходят жалобы: часть запросов обрабатывается «очень долго», хотя средняя по дашборду держится на 7 мс. Общий rps и uptime не изменились.
Как вы будете разбираться и как правильно измерять результат?
- Считать среднее в более узком окне: проблема в усреднении по часу, поминутный график покажет всплески и объяснит, какие именно запросы деградировали
- Ориентироваться на пропускную способность: раз rps не упал, деградации нет, а жалобы объясняются сетью на стороне клиента
- Сравнить среднее с медианой и, если они близки, считать замер корректным и закрыть обращение как невоспроизводимое
- Смотреть перцентили (p95/p99/p99.9) и распределение, а не среднее: длинный хвост среднее почти не сдвигает, но именно его чувствуют клиенты
