Вступить в клуб →
лёгкаявопросМетрики, валидация и выбор модели

Выбор алгоритма для таблицы с категориальными признаками высокой кардинальности

Задача: предсказать вероятность отклика на предложение. Данные табличные, 15 млн строк, 60 признаков, среди них категориальные с высокой кардинальностью — магазин (около 4 тысяч значений), город, товарная категория. Нужен рабочий baseline за пару дней.

Что разумно взять?

  • Полносвязную нейросеть на PyTorch: она сама выучит представления категорий
  • One-hot кодирование всех категорий и логистическую регрессию как самый быстрый вариант
  • Метод ближайших соседей по всем признакам, без обучения он даст baseline быстрее всего
  • Градиентный бустинг на деревьях (CatBoost или LightGBM) с нативной обработкой категорий

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела