Партнёрский API упал, и сервис полностью пропал из балансировки
В readiness-группу health-проверок добавили индикатор, который проверяет доступность партнёрского API рекомендаций. Партнёр лёг на 20 минут: все восемь подов одновременно стали «не готовы», Kubernetes убрал их из балансировки, и перестал работать весь каталог, хотя рекомендации — лишь один блок на странице.
Как правильно?
- Убрать партнёра из readiness и отключать блок при сбое
- Перенести проверку партнёра в liveness-пробу
- Увеличить failureThreshold readiness-пробы до 100
- Проверять партнёра раз в час вместо каждых 10 секунд
