DAG зелёный, а витрина пустая: как сократить время реакции
Ночью источник вернул 0 строк вместо обычных 12 млн: у поставщика была авария выгрузки. Пайплайн отработал штатно — прочитал пустой набор, пересобрал витрину, подменил её в BI. Все задачи зелёные, алертов не было. Проблему обнаружили аналитики к обеду следующего дня, MTTR составил около 20 часов.
Что из перечисленного действительно сократит время обнаружения и реакции в подобных случаях? Выберите два варианта.
правильных вариантов может быть несколько
- Проверка качества данных перед публикацией: сравнение объёма загруженного батча с ожидаемым коридором, свежесть максимальной даты, доля NULL и дублей по ключу — при нарушении задача падает и витрина не подменяется.
- Увеличить число retries на задачах загрузки и добавить растущую паузу между попытками: к третьей попытке источник, скорее всего, восстановится и отдаст данные.
- Алертинг на падение задач (on_failure_callback в мессенджер дежурному) вместе с мониторингом свежести и объёма витрины на дашборде с порогами SLO.
- Ежедневный ручной осмотр логов и витрин дежурным инженером по утрам с отметкой в чек-листе смены.
- Перевести DAG на более частое расписание, каждый час вместо суток: расхождение станет заметно раньше, потому что витрина обновляется чаще.
