База легла на минуту, а оркестратор перезапускал сервис по кругу ещё двадцать
У сервиса одна ручка /health, она делает SELECT 1 в базу. Kubernetes использует её и как liveness-, и как readiness-пробу.
База была недоступна минуту. Все шесть подов ушли в перезапуски, после восстановления базы они одновременно стартовали, открыли пулы соединений, и база снова перестала отвечать. Сервис лежал двадцать минут. Что было ошибкой?
- Liveness-проба зависит от базы: её сбой перезапускает здоровые процессы
- Проба делала SELECT 1, а нужно проверять реальную таблицу
- Слишком мало подов: при шести репликах база всегда перегружена
- Readiness-проба не нужна, если у сервиса есть liveness
