Разбор инцидента с шестью сервисами занял день из-за несвязанных логов
Клиент получил ошибку при оформлении заказа. Запрос прошёл через gateway, orders, stock, payments, notifications и billing. Все логи в одном OpenSearch, но связать записи разных сервисов удалось только по времени с точностью до секунды — при 800 RPS это сотни кандидатов, разбор занял день.
Что внедрить, чтобы такие разборы занимали минуты?
- Сквозной trace_id в заголовке и в каждой записи лога
- Синхронизировать часы всех серверов через NTP
- Писать логи всех сервисов в один общий индекс
- Логировать тело каждого запроса в каждом сервисе
