Случайный идентификатор оказался в топе важности признаков по split
После обучения XGBoost коллега смотрит feature_importance с типом weight (число разбиений). На третьем месте — row_hash, случайное число, попавшее в признаки по ошибке. Коллега делает вывод, что хеш «что-то знает» о целевой переменной.
Как правильно интерпретировать?
- Счётчик разбиений завышает признаки с многими значениями
- Хеш действительно связан с целевой переменной
- Важность признаков в бустинге всегда случайна
- Нужно увеличить глубину деревьев
