Data Scientist
Строит модели машинного обучения, которые предсказывают, рекомендуют и распознают.
- Готовит данные и признаки для моделей
- Обучает и валидирует ML-модели
- Доводит модели до продакшена вместе с инженерами
Портрет сильного резюме
Разобрали 10 топ-резюме специалистов и собрали, что их объединяет: навыки, структура, формулировки и ошибки, которых они избегают.
Ключевые навыки
Сколько топ-резюме из 10 упоминают навык- Python (pandas, NumPy — обработка данных, прототипирование)10/10
- SQL (выгрузка данных, аналитические запросы, витрины)10/10
- scikit-learn (классический ML, пайплайны, метрики)9/10
- Градиентный бустинг: CatBoost / LightGBM / XGBoost9/10
- Математическая статистика и проверка гипотез9/10
- Feature engineering и работа с витринами признаков8/10
- Метрики качества моделей (ROC-AUC, Gini, F1, Precision/Recall, MAPE, NDCG)8/10
- MLOps / вывод моделей в прод (Airflow, MLflow, мониторинг PSI/KS, drift)8/10
- Docker (упаковка и деплой сервисов)8/10
- Прикладные ML-задачи: скоринг/PD, churn, uplift, propensity, fraud/anomaly8/10
- A/B-тестирование и дизайн экспериментов (CUPED, стратификация, DiD/PSM)7/10
- FastAPI (инференс-сервисы, REST API моделей)7/10
- ClickHouse / PostgreSQL / Greenplum7/10
- Git (версионирование кода)7/10
- Английский язык (B2+)7/10
- NLP / эмбеддинги / трансформеры (BERT, ruBERT)6/10
- LLM, RAG и векторный поиск (embeddings, FAISS/Qdrant/Milvus, vLLM)6/10
- PyTorch / Deep Learning6/10
- PySpark / Big Data (обработка больших объёмов)6/10
Чего ждут на каждом грейде
Проектирует и проводит статистическую оценку экспериментов под методологию команды, автоматизирует пайплайны обработки данных, согласует с заказчиком гипотезы и интерпретацию. Осваивает внутреннюю инфраструктуру за несколько месяцев, после чего повышается до middle. Владеет базой Python+SQL+stats.
Самостоятельно ведёт ML-задачу по полному циклу CRISP-DM (от Data Understanding до Deployment): скоринг/PD, churn/uplift, propensity, fraud/anomaly или NLP/LLM-кейсы. Выводит модели в прод, настраивает мониторинг (PSI/KS/Gini, drift) и переобучение в Airflow, проводит A/B-тесты с понижением дисперсии (CUPED, стратификация). Доказывает результат и качеством модели, и бизнес-эффектом.
Отвечает за трек/направление (например, онлайн A/B-тестирование), внедряет методологию (методы снижения дисперсии, валидация сплит-системы, квази-эксперименты DiD/PSM), проектирует end-to-end LLM/RAG-системы с guardrails и оценкой через LLM-as-a-judge. Менторит стажёров/джунов, проводит технические собеседования и код-ревью, выступает на конференциях, синхронится с бизнес-заказчиками и переводит проблему в ML-постановку.
Из каких разделов состоит резюме
- 01Желаемая должность и специализация (Data Scientist / ML Engineer)
- 02Краткое саммари / Обо мне (фокус: classic ML vs LLM, домен, ключевой бизнес-результат)
- 03Опыт работы по местам (роль, домен/индустрия, конкретные ML-проекты)
- 04Достижения с метриками качества модели И бизнес-эффектом внутри каждого проекта
- 05Технологический стек (язык, ML-библиотеки, обработка данных, MLOps/прод)
- 06Образование (профильное: прикладная математика, ПМИ, анализ данных)
- 07Доп. курсы / специализации (Deep Learning, статистика и A/B)
- 08Знание языков (английский B2+)
Как топы описывают достижения
Топы доказывают impact двойной метрикой: качество модели (ROC-AUC 0.78-0.95, Gini 0.55-0.75, F1 0.80-0.88, Recall@3 92%, MAPE 10-18%, NDCG@5 +18%, accuracy 70%→88%) одновременно с измеримым бизнес-эффектом (экономия резервов 34 млн руб/год, доп. поступления 120 млн руб/год, предотвращены выплаты на 340 млн руб, +23% собираемость, churn -10-18%, CTR +14%, CR +9%, conversion 10%→19%, AHT -35-40%, эскалации x2, экономия 24 FTE). Часто указан baseline и масштаб (15М записей, 1 млн клиентов, 100+ A/B тестов, корпус документов). Действие связывает ML-постановку (что за модель, на чём обучена, какой алгоритм) с продакшеном (внедрено, мониторится, переобучается) и деньгами бизнеса.
+ Чем выделяются сильные резюме
Двойная метрика в каждом достижении: качество модели (ROC-AUC/Gini/F1/Recall@k/MAPE) И бизнес-эффект в деньгах или процентах — а не одно из двух
Назван конкретный алгоритм и постановка (LightGBM-классификатор как propensity, S-/T-/X-learner для uplift, BERT с Focal Loss под дисбаланс), а не абстрактное 'обучил модель'
Виден полный цикл CRISP-DM с доведением до прода: мониторинг (PSI/KS/Gini/drift), переобучение в Airflow, валидация (out-of-time, time-based), а не только обучение в Jupyter
Грамотный дизайн экспериментов: A/B с понижением дисперсии (CUPED, стратификация, линеаризация ratio-метрик), квази-эксперименты (DiD, PSM) для случаев без чистого сплита
Указан масштаб и baseline (15М записей, 1 млн клиентов, 100+ A/B, baseline экспертных правил 38%), что доказывает реальный прод, а не учебный датасет
Чёткое позиционирование между classic ML (tabular/скоринг/uplift) и modern stack (NLP/LLM/RAG) — стек не свален в кучу, а отражает фокус
Честная интерпретация результата: иногда модель не сработала (плоская uplift-кривая → отказ от сегментации) — показывает зрелость, а не только победы
Связь с бизнесом и доменом (финтех/банк, ритейл/e-commerce, госсектор): перевод бизнес-проблемы в ML-постановку и обратно
— Типичные ошибки
Перечисление обязанностей без результата ('разрабатывал модели', 'делал feature engineering') в отрыве от метрик качества и бизнес-эффекта
Метрика качества модели (ROC-AUC 0.9) без бизнес-эффекта — или наоборот, проценты роста без указания, что за модель и на чём проверена
Свалка технологий одной строкой без контекста применения и без разделения classic ML / NLP / LLM / прод
Только обучение моделей в Jupyter без доведения до прода, мониторинга и переобучения — 'ноутбучный' DS
A/B-тесты упомянуты как факт без методологии (нет понижения дисперсии, дизайна выборки, валидации сплита)
Лозунги в 'Обо мне' ('командный игрок', 'быстро обучаюсь') вместо стека, фокуса и флагманского кейса
Размытость роли: смешение DS с дата-инженером/аналитиком без чёткого выделения именно ML-вклада и ответственности за качество модели
По каким критериям оценивают
Почти каждый кейс содержит и метрику качества (ROC-AUC, Gini, F1, Recall@k, MAPE, NDCG), и измеримый бизнес-эффект (деньги, %, FTE, конверсия), часто с baseline и масштабом.
Назван конкретный алгоритм под задачу (бустинги для tabular, S-/T-/X-learner для uplift, BERT/RAG для NLP), корректная постановка (целевая метрика, дисбаланс, out-of-time валидация), обоснование выбора.
Модели в продакшене с мониторингом (PSI/KS/Gini/drift), переобучением в Airflow, инференс-сервисами (FastAPI/Docker), версионированием (MLflow) — полный цикл, а не только Jupyter.
Грамотный дизайн A/B с понижением дисперсии (CUPED, стратификация, линеаризация), валидация сплит-системы, квази-эксперименты (DiD, PSM), проверка гипотез и оценка значимости.
Полный современный DS-стек (Python+SQL+scikit-learn+бустинги+stats, при фокусе на LLM — RAG/embeddings/vLLM/трансформеры), осмысленно сгруппирован под специализацию, а не свален одной строкой.
Каждый кейс объясняет ценность для бизнеса и указывает индустрию (финтех/банк, ритейл/e-commerce, госсектор); виден перевод бизнес-проблемы в ML-постановку.
Саммари сразу даёт фокус (classic ML vs LLM) + домен + флагманский кейс; опыт структурирован по проектам с алгоритмом/метрикой/эффектом; без опечаток и пустых лозунгов.
Примеры сильных формулировок
Внедрил поведенческую PD-модель на LightGBM (Gini 0.65-0.75), снизив NPL по сегменту на 10-18% — экономия резервов ~34 млн руб/год.
Спроектировал и провёл 100+ A/B-тестов; внедрил методы снижения дисперсии (CUPED, стратификация, линеаризация ratio-метрик), повысив чувствительность критериев и сократив сроки экспериментов.
Разработал модель классификации обращений на BERT (200+ классов) с Focal Loss под дисбаланс — accuracy 70% → 88%, время ответа -20%.
Построил RAG-систему на open-source LLM + векторном поиске по корпусу регламентов: доля ответов без эскалации 72% против baseline экспертных правил 38%, первый ответ с 4 минут до 12 секунд, экономия ~24 FTE.
Автоматизировал переобучение модели вовлечённости в Airflow с еженедельным обновлением — стабильный Gini >0.55 без drift в течение 2 месяцев.
Протестировал набор uplift-моделей (S-/T-/X-learner на LightGBM) — по плоской uplift-кривой обоснованно отказался от сегментации в пользу работы со всей базой.
Всё для старта и роста в профессии
Вакансии
196 вакансийСвежие вакансии из IT-каналов и hh.ru в одной ленте — с фильтрами по грейду, формату работы и зарплате.
Смотреть вакансии →Тренажёр по профессии
80 задачЗадачи для подготовки к собеседованию: вопросы на понимание и задачи на код с автопроверкой и разбором.
Решать задачи →Виртуальное собеседование
98 вопросовСобеседование с ИИ-интервьюером по банку вопросов профессии. Докапывается как живой, в конце — балл и разбор.
Подробнее →Менторы
Практикующие специалисты из индустрии: мок-собеседование, разбор резюме, план роста.
Выбрать ментора →Прожарка резюме
ИИИИ сверяет резюме с топ-10 резюме профессии и честно показывает, что мешает получить оффер.
Подробнее →Создание резюме
ШаблонСильное резюме с нуля — секция за секцией, по примеру лучших резюме профессии.
Подробнее →Улучшение резюме
ИИИИ переписывает резюме по замечаниям прожарки и адаптирует его под конкретную вакансию.
Подробнее →Книги
КлубПутеводители клуба по поиску работы в IT: от резюме до переговоров об оффере.
Читать книги →Вакансии, тренажёр, собеседования, менторы и разбор резюме по одной подписке.
