Вступить в клуб →

Data Scientist

Строит модели машинного обучения, которые предсказывают, рекомендуют и распознают.

Чем занимается
  • Готовит данные и признаки для моделей
  • Обучает и валидирует ML-модели
  • Доводит модели до продакшена вместе с инженерами

Портрет сильного резюме

Разобрали 10 топ-резюме специалистов и собрали, что их объединяет: навыки, структура, формулировки и ошибки, которых они избегают.

Ключевые навыки

Сколько топ-резюме из 10 упоминают навык
  • Python (pandas, NumPy — обработка данных, прототипирование)10/10
  • SQL (выгрузка данных, аналитические запросы, витрины)10/10
  • scikit-learn (классический ML, пайплайны, метрики)9/10
  • Градиентный бустинг: CatBoost / LightGBM / XGBoost9/10
  • Математическая статистика и проверка гипотез9/10
  • Feature engineering и работа с витринами признаков8/10
  • Метрики качества моделей (ROC-AUC, Gini, F1, Precision/Recall, MAPE, NDCG)8/10
  • MLOps / вывод моделей в прод (Airflow, MLflow, мониторинг PSI/KS, drift)8/10
  • Docker (упаковка и деплой сервисов)8/10
  • Прикладные ML-задачи: скоринг/PD, churn, uplift, propensity, fraud/anomaly8/10
  • A/B-тестирование и дизайн экспериментов (CUPED, стратификация, DiD/PSM)7/10
  • FastAPI (инференс-сервисы, REST API моделей)7/10
  • ClickHouse / PostgreSQL / Greenplum7/10
  • Git (версионирование кода)7/10
  • Английский язык (B2+)7/10
  • NLP / эмбеддинги / трансформеры (BERT, ruBERT)6/10
  • LLM, RAG и векторный поиск (embeddings, FAISS/Qdrant/Milvus, vLLM)6/10
  • PyTorch / Deep Learning6/10
  • PySpark / Big Data (обработка больших объёмов)6/10

Чего ждут на каждом грейде

Junior

Проектирует и проводит статистическую оценку экспериментов под методологию команды, автоматизирует пайплайны обработки данных, согласует с заказчиком гипотезы и интерпретацию. Осваивает внутреннюю инфраструктуру за несколько месяцев, после чего повышается до middle. Владеет базой Python+SQL+stats.

Middle

Самостоятельно ведёт ML-задачу по полному циклу CRISP-DM (от Data Understanding до Deployment): скоринг/PD, churn/uplift, propensity, fraud/anomaly или NLP/LLM-кейсы. Выводит модели в прод, настраивает мониторинг (PSI/KS/Gini, drift) и переобучение в Airflow, проводит A/B-тесты с понижением дисперсии (CUPED, стратификация). Доказывает результат и качеством модели, и бизнес-эффектом.

Senior

Отвечает за трек/направление (например, онлайн A/B-тестирование), внедряет методологию (методы снижения дисперсии, валидация сплит-системы, квази-эксперименты DiD/PSM), проектирует end-to-end LLM/RAG-системы с guardrails и оценкой через LLM-as-a-judge. Менторит стажёров/джунов, проводит технические собеседования и код-ревью, выступает на конференциях, синхронится с бизнес-заказчиками и переводит проблему в ML-постановку.

Из каких разделов состоит резюме

  1. 01Желаемая должность и специализация (Data Scientist / ML Engineer)
  2. 02Краткое саммари / Обо мне (фокус: classic ML vs LLM, домен, ключевой бизнес-результат)
  3. 03Опыт работы по местам (роль, домен/индустрия, конкретные ML-проекты)
  4. 04Достижения с метриками качества модели И бизнес-эффектом внутри каждого проекта
  5. 05Технологический стек (язык, ML-библиотеки, обработка данных, MLOps/прод)
  6. 06Образование (профильное: прикладная математика, ПМИ, анализ данных)
  7. 07Доп. курсы / специализации (Deep Learning, статистика и A/B)
  8. 08Знание языков (английский B2+)

Как топы описывают достижения

Топы доказывают impact двойной метрикой: качество модели (ROC-AUC 0.78-0.95, Gini 0.55-0.75, F1 0.80-0.88, Recall@3 92%, MAPE 10-18%, NDCG@5 +18%, accuracy 70%→88%) одновременно с измеримым бизнес-эффектом (экономия резервов 34 млн руб/год, доп. поступления 120 млн руб/год, предотвращены выплаты на 340 млн руб, +23% собираемость, churn -10-18%, CTR +14%, CR +9%, conversion 10%→19%, AHT -35-40%, эскалации x2, экономия 24 FTE). Часто указан baseline и масштаб (15М записей, 1 млн клиентов, 100+ A/B тестов, корпус документов). Действие связывает ML-постановку (что за модель, на чём обучена, какой алгоритм) с продакшеном (внедрено, мониторится, переобучается) и деньгами бизнеса.

+ Чем выделяются сильные резюме

Двойная метрика в каждом достижении: качество модели (ROC-AUC/Gini/F1/Recall@k/MAPE) И бизнес-эффект в деньгах или процентах — а не одно из двух

Назван конкретный алгоритм и постановка (LightGBM-классификатор как propensity, S-/T-/X-learner для uplift, BERT с Focal Loss под дисбаланс), а не абстрактное 'обучил модель'

Виден полный цикл CRISP-DM с доведением до прода: мониторинг (PSI/KS/Gini/drift), переобучение в Airflow, валидация (out-of-time, time-based), а не только обучение в Jupyter

Грамотный дизайн экспериментов: A/B с понижением дисперсии (CUPED, стратификация, линеаризация ratio-метрик), квази-эксперименты (DiD, PSM) для случаев без чистого сплита

Указан масштаб и baseline (15М записей, 1 млн клиентов, 100+ A/B, baseline экспертных правил 38%), что доказывает реальный прод, а не учебный датасет

Чёткое позиционирование между classic ML (tabular/скоринг/uplift) и modern stack (NLP/LLM/RAG) — стек не свален в кучу, а отражает фокус

Честная интерпретация результата: иногда модель не сработала (плоская uplift-кривая → отказ от сегментации) — показывает зрелость, а не только победы

Связь с бизнесом и доменом (финтех/банк, ритейл/e-commerce, госсектор): перевод бизнес-проблемы в ML-постановку и обратно

— Типичные ошибки

Перечисление обязанностей без результата ('разрабатывал модели', 'делал feature engineering') в отрыве от метрик качества и бизнес-эффекта

Метрика качества модели (ROC-AUC 0.9) без бизнес-эффекта — или наоборот, проценты роста без указания, что за модель и на чём проверена

Свалка технологий одной строкой без контекста применения и без разделения classic ML / NLP / LLM / прод

Только обучение моделей в Jupyter без доведения до прода, мониторинга и переобучения — 'ноутбучный' DS

A/B-тесты упомянуты как факт без методологии (нет понижения дисперсии, дизайна выборки, валидации сплита)

Лозунги в 'Обо мне' ('командный игрок', 'быстро обучаюсь') вместо стека, фокуса и флагманского кейса

Размытость роли: смешение DS с дата-инженером/аналитиком без чёткого выделения именно ML-вклада и ответственности за качество модели

По каким критериям оценивают

24%
Измеримость: качество модели + бизнес-эффект

Почти каждый кейс содержит и метрику качества (ROC-AUC, Gini, F1, Recall@k, MAPE, NDCG), и измеримый бизнес-эффект (деньги, %, FTE, конверсия), часто с baseline и масштабом.

20%
Глубина ML: алгоритмы, постановка, валидация

Назван конкретный алгоритм под задачу (бустинги для tabular, S-/T-/X-learner для uplift, BERT/RAG для NLP), корректная постановка (целевая метрика, дисбаланс, out-of-time валидация), обоснование выбора.

16%
Доведение до прода и MLOps

Модели в продакшене с мониторингом (PSI/KS/Gini/drift), переобучением в Airflow, инференс-сервисами (FastAPI/Docker), версионированием (MLflow) — полный цикл, а не только Jupyter.

14%
Эксперименты и статистика (A/B, причинность)

Грамотный дизайн A/B с понижением дисперсии (CUPED, стратификация, линеаризация), валидация сплит-системы, квази-эксперименты (DiD, PSM), проверка гипотез и оценка значимости.

12%
Релевантность и структура стека

Полный современный DS-стек (Python+SQL+scikit-learn+бустинги+stats, при фокусе на LLM — RAG/embeddings/vLLM/трансформеры), осмысленно сгруппирован под специализацию, а не свален одной строкой.

8%
Связь с бизнесом и доменом

Каждый кейс объясняет ценность для бизнеса и указывает индустрию (финтех/банк, ритейл/e-commerce, госсектор); виден перевод бизнес-проблемы в ML-постановку.

6%
Структура, чистота и саммари резюме

Саммари сразу даёт фокус (classic ML vs LLM) + домен + флагманский кейс; опыт структурирован по проектам с алгоритмом/метрикой/эффектом; без опечаток и пустых лозунгов.

Примеры сильных формулировок

Внедрил поведенческую PD-модель на LightGBM (Gini 0.65-0.75), снизив NPL по сегменту на 10-18% — экономия резервов ~34 млн руб/год.
Спроектировал и провёл 100+ A/B-тестов; внедрил методы снижения дисперсии (CUPED, стратификация, линеаризация ratio-метрик), повысив чувствительность критериев и сократив сроки экспериментов.
Разработал модель классификации обращений на BERT (200+ классов) с Focal Loss под дисбаланс — accuracy 70% → 88%, время ответа -20%.
Построил RAG-систему на open-source LLM + векторном поиске по корпусу регламентов: доля ответов без эскалации 72% против baseline экспертных правил 38%, первый ответ с 4 минут до 12 секунд, экономия ~24 FTE.
Автоматизировал переобучение модели вовлечённости в Airflow с еженедельным обновлением — стабильный Gini >0.55 без drift в течение 2 месяцев.
Протестировал набор uplift-моделей (S-/T-/X-learner на LightGBM) — по плоской uplift-кривой обоснованно отказался от сегментации в пользу работы со всей базой.

Всё для старта и роста в профессии

Вакансии

196 вакансий

Свежие вакансии из IT-каналов и hh.ru в одной ленте — с фильтрами по грейду, формату работы и зарплате.

Смотреть вакансии →

Тренажёр по профессии

80 задач

Задачи для подготовки к собеседованию: вопросы на понимание и задачи на код с автопроверкой и разбором.

Решать задачи →

Виртуальное собеседование

98 вопросов

Собеседование с ИИ-интервьюером по банку вопросов профессии. Докапывается как живой, в конце — балл и разбор.

Подробнее →

Менторы

Практикующие специалисты из индустрии: мок-собеседование, разбор резюме, план роста.

Выбрать ментора →

Прожарка резюме

ИИ

ИИ сверяет резюме с топ-10 резюме профессии и честно показывает, что мешает получить оффер.

Подробнее →

Создание резюме

Шаблон

Сильное резюме с нуля — секция за секцией, по примеру лучших резюме профессии.

Подробнее →

Улучшение резюме

ИИ

ИИ переписывает резюме по замечаниям прожарки и адаптирует его под конкретную вакансию.

Подробнее →

Книги

Клуб

Путеводители клуба по поиску работы в IT: от резюме до переговоров об оффере.

Читать книги →
Все сервисы — в одном клубе

Вакансии, тренажёр, собеседования, менторы и разбор резюме по одной подписке.

Вступить в клуб →