drop_duplicates отработал, а дубли событий остались
Одно и то же событие приезжает из двух источников. Все бизнес-поля совпадают (event_id, user_id, event_time, amount), но техническое поле load_ts — момент загрузки — у копий разное.
Аналитик вызвал df.drop_duplicates(), число строк не изменилось. Почему и как правильно?
- drop_duplicates удаляет только идущие подряд дубли, сначала нужен sort_values
- Нужно передать keep=False, иначе pandas сохраняет обе копии строки
- Без subset сравниваются все столбцы, а load_ts у копий разный
- Метод не сравнивает столбцы с датами, load_ts требуется предварительно привести к строке
