Вступить в клуб →
средняявопросPython, витрины и качество данных

drop_duplicates отработал, а дубли событий остались

Одно и то же событие приезжает из двух источников. Все бизнес-поля совпадают (event_id, user_id, event_time, amount), но техническое поле load_ts — момент загрузки — у копий разное.

Аналитик вызвал df.drop_duplicates(), число строк не изменилось. Почему и как правильно?

  • drop_duplicates удаляет только идущие подряд дубли, сначала нужен sort_values
  • Нужно передать keep=False, иначе pandas сохраняет обе копии строки
  • Без subset сравниваются все столбцы, а load_ts у копий разный
  • Метод не сравнивает столбцы с датами, load_ts требуется предварительно привести к строке

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела