Эффекта нет по общей метрике, но нашёлся один значимый сегмент
Тест завершён: по основной метрике различий нет (p = 0.62). Аналитик нарезал результат на 12 сегментов (платформы, города, новые и старые пользователи) и в одном из них получил p = 0.04. Продакт предлагает раскатать фичу на этот сегмент.
Что корректно ответить?
- Раскатать фичу на найденный сегмент: в нём эффект статистически подтверждён на том же уровне значимости 0.05
- Долить трафик именно в этот сегмент и досчитать тест до более уверенного p-value, а потом принимать решение
- При 12 сравнениях один значимый результат ожидаем случайно: нужна поправка и подтверждающий тест на сегменте
- Снизить требования к значимости до 0.1: сегмент маленький, поэтому критерий надо ослабить
