Выбор алгоритма для таблицы с категориальными признаками высокой кардинальности
Задача: предсказать вероятность отклика на предложение. Данные табличные, 15 млн строк, 60 признаков, среди них категориальные с высокой кардинальностью — магазин (около 4 тысяч значений), город, товарная категория. Нужен рабочий baseline за пару дней.
Что разумно взять?
- Полносвязную нейросеть на PyTorch: она сама выучит представления категорий
- One-hot кодирование всех категорий и логистическую регрессию как самый быстрый вариант
- Метод ближайших соседей по всем признакам, без обучения он даст baseline быстрее всего
- Градиентный бустинг на деревьях (CatBoost или LightGBM) с нативной обработкой категорий
