Data Engineer
Строит трубопроводы данных: собирает, чистит и доставляет данные туда, где их анализируют.
- Строит ETL/ELT-пайплайны
- Работает со Spark, Airflow, Kafka и хранилищами
- Отвечает за качество и доступность данных
Портрет сильного резюме
Разобрали 10 топ-резюме специалистов и собрали, что их объединяет: навыки, структура, формулировки и ошибки, которых они избегают.
Ключевые навыки
Сколько топ-резюме из 10 упоминают навык- Python (ETL-скрипты, pandas/PySpark)10/10
- SQL (аналитические запросы, оконные функции, CTE, оптимизация)10/10
- Apache Airflow (DAG-и, кастомные операторы, сенсоры, ретраи)10/10
- PostgreSQL10/10
- ClickHouse (движки MergeTree, партиционирование, кодеки сжатия)9/10
- Apache Spark / PySpark (оптимизация, data skew, broadcast)9/10
- Построение DWH со слоистой архитектурой (RAW/ODS/DDS/DM/Marts)9/10
- Data Quality (проверки NULL/дублей/диапазонов, алертинг)9/10
- Apache Kafka (потоковая поставка, CDC)8/10
- dbt (моделирование витрин, инкрементальная загрузка, dbt-тесты)8/10
- Docker / Kubernetes8/10
- Greenplum7/10
- CI/CD (Git/GitLab/Jenkins/TeamCity)7/10
- S3 / MinIO, форматы Parquet7/10
- Английский язык (B1-B2)7/10
- Hadoop / HDFS / Hive6/10
- Apache Iceberg / Data Lakehouse4/10
- Trino (ad-hoc запросы)3/10
Чего ждут на каждом грейде
Самостоятельно разрабатывает и поддерживает 15-30+ ETL/ELT-пайплайнов в Airflow, проектирует витрины и слои DWH, оптимизирует SQL/Spark-запросы, внедряет базовый Data Quality. Владеет полным стеком Python+SQL+Airflow+ClickHouse/Greenplum. Метрики результата формулирует на уровне своих пайплайнов (ускорение, снижение инцидентов).
Проектирует архитектуру DWH/Data Lakehouse с нуля (слоистость, Data Vault 2.0, Iceberg), решает сложные перформанс-проблемы (data skew, salting, OOM, AQE), внедряет CI/CD и DQ-фреймворки, отвечает за SLA/SLO и on-call. Работает с масштабом в млрд строк/сотни ТБ, мигрирует legacy-стек (SAS/Oracle → современный), влияет на TCO кластера и стоимость инфраструктуры. Менторит и координирует мини-группы инженеров.
Управляет командой инженеров/аналитиков, владеет процессами разработки (Lead Time, Time-to-Market на уровне департамента), отвечает за финансовую эффективность (прямая экономия бюджета), стратегию миграций и импортозамещения, построение команд и культуру развития (ИПР, 1:1). Совмещает техническую глубину DWH с people/stakeholder-менеджментом.
Из каких разделов состоит резюме
- 01Желаемая должность и специализация
- 02Краткое саммари / Обо мне (стек + фокус + ключевой результат)
- 03Опыт работы по местам (роль, домен/индустрия, проект, команда)
- 04Достижения с измеримыми метриками внутри каждого места
- 05Технологический стек (явно сгруппированный: языки, обработка, хранилища, оркестрация, DevOps)
- 06Образование
- 07Знание языков (английский)
Как топы описывают достижения
Топы доказывают impact через измеримые before→after метрики с указанием baseline и масштаба: время сборки витрины (3 часа → 12 минут), отчётов (45 минут → 8 секунд), MTTR (4 часа → 30 минут), задержка стриминга (10 минут → 2 минуты), throughput (200к+ строк/сек, 500k событий/сек, 10k событий/мин), снижение инцидентов (с 8 до 1-2 в месяц, на 75-80%), экономия инфраструктуры/бюджета (в 2 раза, 30 млн руб/год, -30% диска). Масштаб данных назван явно (1.5 млрд строк, 200 ТБ, 10 млн событий/сутки, 50+ филиалов, 100+ поставщиков). Каждое достижение связывает техническое действие (что сделал) с бизнес-результатом (зачем — соблюдение SLA, актуальность данных для бизнеса, разгрузка аналитиков).
+ Чем выделяются сильные резюме
Каждое достижение содержит метрику с baseline (было → стало), а не просто перечень обязанностей
Явно назван масштаб данных (млрд строк, ТБ, события/сек) — доказывает работу с реальным highload
Описаны конкретные техники оптимизации, а не общие слова: salting, broadcast joins, AQE, ключи партиционирования, кодеки сжатия ZSTD, skipping indexes, материализованные представления
Технологический стек сгруппирован осмысленно (языки / обработка / хранилища / оркестрация / DevOps), а не свален в одну строку
Связь техники с бизнес-результатом: ускорение → соблюдение SLA, DQ → меньше инцидентов в отчётности, разгрузка аналитиков
Понимание слоистой архитектуры DWH (RAW/ODS/DDS/Marts) и подходов (Data Vault, Lakehouse, SCD2, CDC/Debezium)
Краткое саммари сразу даёт стек + специализацию + 1-2 флагманских кейса
— Типичные ошибки
Перечисление обязанностей без результата и метрик ('разрабатывал ETL', 'писал SQL') в отрыве от impact
Список технологий без контекста применения и без указания масштаба/нагрузки
Размытые формулировки достижений ('ускорил в несколько раз', 'оптимизировал запросы') без baseline-цифр
Перегруз нерелевантными офисными навыками (MS Word/Visio/Outlook, сводные таблицы) вместо инженерного стека
Лозунги в 'Обо мне' ('командный игрок', 'высокая коммуникабельность', 'стремление к знаниям') без подтверждения фактами
Смешивание ролей DE с аналитиком/PM без чёткого разделения инженерного вклада
Опечатки и сленг в деловом тексте ('съэкономило много денег', 'не задыхалась утром')
По каким критериям оценивают
Почти каждый буллет — результат в формате было→стало с цифрами: время, throughput, инциденты, деньги. Метрики привязаны к SLA и бизнес-эффекту.
Полный современный DE-стек (Python+SQL+Airflow+Spark+ClickHouse/Greenplum+dbt+Kafka), сгруппирован по категориям, с указанием конкретных техник и движков, а не просто названий.
Показано проектирование слоистого DWH (RAW/ODS/DDS/Marts), знание Data Vault 2.0, SCD2, CDC, Lakehouse/Iceberg; решения обоснованы (lineage, идемпотентность, дедупликация).
Назван реальный масштаб (млрд строк, ТБ, события/сек) и описаны конкретные приёмы оптимизации перформанса и стоимости (skew, salting, партиционирование, сжатие, TTL).
Внедрены DQ-проверки и фреймворки, мониторинг/алертинг, CI/CD, тесты; результат — снижение инцидентов и MTTR, соблюдение SLA, on-call.
Каждый кейс объясняет зачем бизнесу (актуальность данных, разгрузка аналитиков, экономия, ускорение TTM); указана индустрия (финтех/банк, e-commerce/ритейл, медицина).
Чёткая структура: саммари со стеком и фокусом, опыт с проектом/командой/стеком/достижениями, сгруппированные навыки. Без опечаток, сленга и общих лозунгов.
Примеры сильных формулировок
Оптимизировал SQL-запросы в DWH: вынес фильтрацию до JOIN через CTE, добавил партиционирование по дате и индексы — время сборки ключевой витрины продаж сократилось с 3 часов до 12 минут.
Спроектировал четырёхслойную архитектуру DWH (RAW → ODS → DDS → Marts) на dbt, обеспечив прозрачный data lineage и удобство разработки витрин.
Устранил data skew в Spark-пайплайнах (salting, broadcast joins, перенастройка ключей партиционирования) — время выполнения задачи -20%, ресурсы кластера -10%, полностью убраны OOM на воркерах.
Внедрил Data Quality Framework на dbt-тестах с валидацией бизнес-правил — число DQ-инцидентов сократилось на 75%, некорректные данные больше не попадают в витрины BI.
Реализовал near-real-time доставку событий Kafka → ClickHouse с дедупликацией на оконных функциях: пропускная способность до 500k событий/сек при E2E latency ≤ 15 минут.
Настроил мониторинг и алертинг (Grafana, SLO, on_failure_callback) — MTTR критических пайплайнов сократился с 4 часов до 30 минут.
Всё для старта и роста в профессии
Вакансии
83 вакансииСвежие вакансии из IT-каналов и hh.ru в одной ленте — с фильтрами по грейду, формату работы и зарплате.
Смотреть вакансии →Тренажёр по профессии
80 задачЗадачи для подготовки к собеседованию: вопросы на понимание и задачи на код с автопроверкой и разбором.
Решать задачи →Виртуальное собеседование
78 вопросовСобеседование с ИИ-интервьюером по банку вопросов профессии. Докапывается как живой, в конце — балл и разбор.
Подробнее →Менторы
Практикующие специалисты из индустрии: мок-собеседование, разбор резюме, план роста.
Выбрать ментора →Прожарка резюме
ИИИИ сверяет резюме с топ-10 резюме профессии и честно показывает, что мешает получить оффер.
Подробнее →Создание резюме
ШаблонСильное резюме с нуля — секция за секцией, по примеру лучших резюме профессии.
Подробнее →Улучшение резюме
ИИИИ переписывает резюме по замечаниям прожарки и адаптирует его под конкретную вакансию.
Подробнее →Книги
КлубПутеводители клуба по поиску работы в IT: от резюме до переговоров об оффере.
Читать книги →Вакансии, тренажёр, собеседования, менторы и разбор резюме по одной подписке.
