В 1000 A/A-прогонах p < 0,05 получилось в 17% случаев
Перед запуском новой платформы экспериментов аналитик прогнал 1000 A/A-тестов на исторических данных: пользователей случайно делили на две группы без всякого воздействия и считали p-value по конверсии в заказ тем же методом, что и в боевых тестах. В 17% прогонов p < 0,05.
Что это значит?
- Метод завышает значимость, надо искать ошибку
- Всё нормально: A/A-тесты всегда шумят
- Нужно поднять порог значимости до 0,2
- В 17% случаев группы реально различались
