Зачем в эскалации указывать trace_id запроса, а не только время ошибки
Клиент прислал скриншот с сообщением «Что-то пошло не так» и указал время 14:32. В ответе API вы нашли заголовок с идентификатором запроса trace_id. Продукт состоит из шести сервисов, каждый пишет логи в общий ELK, суммарно это десятки тысяч записей в минуту.
Почему для эскалации важен именно trace_id?
- Он собирает записи всех сервисов по одному запросу, а по времени 14:32 в выдачу попадут тысячи чужих запросов
- По нему разработчик сможет войти в систему под учётной записью клиента и увидеть ту же ошибку своими глазами, не запрашивая доступ
- Он заменяет шаги воспроизведения: по trace_id тестовый стенд сам повторяет тот же запрос и воспроизводит ошибку
- Он нужен для подсчёта количества обращений в месячной отчётности и для сверки нагрузки между сервисами
