Упал один из двух узлов etcd, и Patroni перевёл лидера в режим только чтения
Кластер: три узла PostgreSQL под Patroni, etcd из двух узлов для экономии. Ночью один узел etcd вышел из строя из-за диска. Сервер с основной базой был исправен, но Patroni понизил его до реплики, и приложение 20 минут получало ошибки записи. Новый лидер тоже не был выбран.
Как это исправить в архитектуре?
- etcd из трёх узлов на разных хостах
- Добавить четвёртый узел PostgreSQL
- Увеличить ttl лидера в Patroni до 10 минут
- Разнести два узла etcd по разным стойкам
