Определение
Проверка гипотез — это статистический метод, при котором на основе данных выборки принимается решение о том, подтверждается ли предположение относительно всей генеральной совокупности. В контексте DTC- и e-commerce-аналитики это основной инструмент для проверки изменений: новой посадочной страницы, ставки в рекламе, порога бесплатной доставки, сегмента рассылки или алгоритма рекомендаций.
Простыми словами: вы не можете опросить всех клиентов, но можете взять часть данных и с определённой уверенностью сказать, реально ли изменение повлияло на метрику или это случайность.
Аналогия из e-commerce
Представьте, что вы тестируете два варианта карточки товара:
- Вариант A (контроль): текущая карточка, конверсия 3,2%.
- Вариант B (тест): новая карточка с другим главным фото и оффером, конверсия 3,6%.
Разница есть — но она может быть случайной: например, в тестовую группу попали более «горячие» посетители из ретаргетинга. Проверка гипотез отвечает на вопрос: достаточно ли велика разница, чтобы считать её системной, а не шумом?
Нулевая гипотеза (H₀) обычно звучит так: «разницы нет, новая карточка работает так же, как старая». Альтернативная (H₁): «разница есть, новая карточка меняет конверсию».
Формулы
1. Z-тест для двух пропорций (конверсия, CTR, CR)
Для сравнения конверсий двух групп:
$$
Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}
$$
где:
- $\hat{p}_1, \hat{p}_2$ — конверсии в группах,
- $\hat{p}$ — объединённая конверсия,
- $n_1, n_2$ — размеры выборок.
2. T-тест для среднего (AOV, LTV, время на сайте)
$$
t = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}
$$
где $\bar{x}$ — средние, $s^2$ — дисперсии групп.
3. P-value и уровень значимости
p-value — вероятность получить такую или более экстремальную разницу, если H₀ верна. Если $p < \alpha$ (обычно $\alpha = 0,05$), H₀ отвергается.
Пример с данными:
- Контроль: 12 400 сессий, 397 заказов, CR = 3,20%.
- Тест: 12 350 сессий, 445 заказов, CR = 3,60%.
- Z ≈ 1,72; p ≈ 0,085.
- При $\alpha = 0,05$ разница не значима. При $\alpha = 0,10$ — значима.
Сравнение методов
| Метод | Когда применять | Метрика | Пример в DTC |
|---|---|---|---|
| Z-тест пропорций | Большие выборки, конверсии | CR, CTR, open rate | Тест двух карточек товара |
| T-тест Уэлча | Средние, неравные дисперсии | AOV, LTV, время сессии | Сравнение среднего чека |
| Хи-квадрат | Категориальные данные | Распределение заказов | Разбивка по категориям |
| ANOVA | 3+ группы | Средние | 3 варианта email-рассылки |
| Байесовский A/B | Малые выборки, быстрые решения | Вероятность превосходства | Тест в узкой нише |
Применение в DTC и e-commerce
1. A/B-тест посадочной страницы. Проверяете, повышает ли новый блок с отзывами конверсию с 3,2% до 3,6% на 25 000 сессиях.
2. Тест ставки в рекламе. Сравниваете ROAS двух кампаний: 2,8 против 3,1 при 8 000 кликов.
3. Порог бесплатной доставки. Меняете с 5 000 ₽ на 4 000 ₽ и проверяете, растёт ли AOV с 6 200 ₽ до 6 450 ₽.
4. Сегментация email. Тестируете тему письма: open rate 18,4% против 21,1% на 40 000 контактов.
5. Рекомендательный алгоритм. Сравниваете долю добавлений в корзину: 7,1% против 7,9%.
Частые ошибки
- Подглядывание (peeking). Останавливать тест, как только p < 0,05, — это inflates false positive rate до 20–30%.
- Недостаточная мощность. Если в группе 500 сессий, вы не поймаете рост CR на 0,4 п.п.
- Множественные сравнения. 10 метрик × 10 сегментов = 100 тестов; при $\alpha = 0,05$ ожидаемо 5 ложных срабатываний. Нужна поправка Бонферрони или FDR.
- Игнорирование практической значимости. p = 0,04 при росте CR на 0,05 п.п. может не окупить разработку.
- Смещение выборки. Если тест запущен только на лояльных клиентах, результат не масштабируется на всех.
- Преждевременная остановка по времени, а не по размеру выборки.
Связанные термины
- A/B-тестирование — практическое применение проверки гипотез.
- Доверительный интервал — диапазон, в котором с заданной вероятностью лежит истинный эффект.
- Статистическая мощность — вероятность обнаружить реальный эффект (обычно ≥ 80%).
- Ошибка I рода (α) — ложное отклонение H₀.
- Ошибка II рода (β) — пропуск реального эффекта.
- MDE (Minimum Detectable Effect) — минимальный эффект, который тест способен поймать.
- Байесовский вывод — альтернативный подход без p-value.
- Sequential testing — метод, позволяющий безопасно смотреть на данные во время теста.