Эффекта в целом нет, но в одном из 12 сегментов B выигрывает с p = 0,03
Тест завершился без значимого эффекта на всей аудитории. Аналитик разложил результат на 12 сегментов и нашёл один, где B выигрывает с p = 0,03: пользователи Android из городов-миллионников, впервые зашедшие с мобильного. Команда предлагает раскатать фичу на этот сегмент.
Что здесь не так?
- Проблем нет: значимость получена, а раскатка только на выигравший сегмент — заведомо осторожный шаг.
- При 12 проверках одно «значимое» срабатывание ожидаемо случайно: это гипотеза, её надо подтвердить отдельным тестом.
- Сегмент слишком узкий: его нужно объединить с соседними и пересчитать значимость по объединению.
- Дело в платформе: результаты по Android нельзя сопоставлять с общей выборкой теста, где есть и iOS.
