Тест на 2 000 пользователей в группе не показал значимости
Результаты эксперимента: контроль — конверсия 4,0%, тест — 4,4%, по 2 000 пользователей в каждой группе, p-value = 0,42.
Какой вывод корректен?
- Различий не нашли, но и мощности поймать 0,4 п.п. на такой выборке не было
- Доказано, что варианты работают одинаково, изменение можно откатывать
- Эффект есть, просто слабый: 4,4% против 4,0% — это рост на 10%
- Тест не удался из-за ошибки в разделении трафика, результаты считать нельзя
