Упали оплата и каталог: виноват релиз каталога или что-то общее?
Сводка первых ошибок по сервисам во время инцидента:
14:00:00 catalog deploy v2.31 started
14:01:07 payments ERROR DB_TIMEOUT pool exhausted
14:01:09 catalog ERROR DB_TIMEOUT pool exhausted
14:01:30 postgres WARN failover: replica promoted
14:02:40 payments ERROR PAY_FAILED (x 1400)
14:03:10 catalog deploy v2.31 finished
Оба сервиса ходят в один кластер PostgreSQL. Дежурный разработчик каталога откатывает релиз, но ошибки продолжаются. Какую гипотезу разумнее поставить первой в эскалации?
- Общая зависимость: проблемы с кластером БД
- Релиз каталога: он ближе всего по времени
- Платёжный сервис: у него больше всего ошибок
- Сеть между клиентами и балансировщиком
