ZHENESJAKOTHVIRUFRAR

Hypothesis Testing

Определение

Проверка гипотез — это статистический метод, при котором на основе данных выборки принимается решение о том, подтверждается ли предположение относительно всей генеральной совокупности. В контексте DTC- и e-commerce-аналитики это основной инструмент для проверки изменений: новой посадочной страницы, ставки в рекламе, порога бесплатной доставки, сегмента рассылки или алгоритма рекомендаций.

Простыми словами: вы не можете опросить всех клиентов, но можете взять часть данных и с определённой уверенностью сказать, реально ли изменение повлияло на метрику или это случайность.

Аналогия из e-commerce

Представьте, что вы тестируете два варианта карточки товара:

- Вариант A (контроль): текущая карточка, конверсия 3,2%.

- Вариант B (тест): новая карточка с другим главным фото и оффером, конверсия 3,6%.

Разница есть — но она может быть случайной: например, в тестовую группу попали более «горячие» посетители из ретаргетинга. Проверка гипотез отвечает на вопрос: достаточно ли велика разница, чтобы считать её системной, а не шумом?

Нулевая гипотеза (H₀) обычно звучит так: «разницы нет, новая карточка работает так же, как старая». Альтернативная (H₁): «разница есть, новая карточка меняет конверсию».

Формулы

1. Z-тест для двух пропорций (конверсия, CTR, CR)

Для сравнения конверсий двух групп:

$$

Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}

$$

где:

- $\hat{p}_1, \hat{p}_2$ — конверсии в группах,

- $\hat{p}$ — объединённая конверсия,

- $n_1, n_2$ — размеры выборок.

2. T-тест для среднего (AOV, LTV, время на сайте)

$$

t = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}

$$

где $\bar{x}$ — средние, $s^2$ — дисперсии групп.

3. P-value и уровень значимости

p-value — вероятность получить такую или более экстремальную разницу, если H₀ верна. Если $p < \alpha$ (обычно $\alpha = 0,05$), H₀ отвергается.

Пример с данными:

- Контроль: 12 400 сессий, 397 заказов, CR = 3,20%.

- Тест: 12 350 сессий, 445 заказов, CR = 3,60%.

- Z ≈ 1,72; p ≈ 0,085.

- При $\alpha = 0,05$ разница не значима. При $\alpha = 0,10$ — значима.

Сравнение методов

МетодКогда применятьМетрикаПример в DTC
Z-тест пропорцийБольшие выборки, конверсииCR, CTR, open rateТест двух карточек товара
T-тест УэлчаСредние, неравные дисперсииAOV, LTV, время сессииСравнение среднего чека
Хи-квадратКатегориальные данныеРаспределение заказовРазбивка по категориям
ANOVA3+ группыСредние3 варианта email-рассылки
Байесовский A/BМалые выборки, быстрые решенияВероятность превосходстваТест в узкой нише

Применение в DTC и e-commerce

1. A/B-тест посадочной страницы. Проверяете, повышает ли новый блок с отзывами конверсию с 3,2% до 3,6% на 25 000 сессиях.

2. Тест ставки в рекламе. Сравниваете ROAS двух кампаний: 2,8 против 3,1 при 8 000 кликов.

3. Порог бесплатной доставки. Меняете с 5 000 ₽ на 4 000 ₽ и проверяете, растёт ли AOV с 6 200 ₽ до 6 450 ₽.

4. Сегментация email. Тестируете тему письма: open rate 18,4% против 21,1% на 40 000 контактов.

5. Рекомендательный алгоритм. Сравниваете долю добавлений в корзину: 7,1% против 7,9%.

Частые ошибки

- Подглядывание (peeking). Останавливать тест, как только p < 0,05, — это inflates false positive rate до 20–30%.

- Недостаточная мощность. Если в группе 500 сессий, вы не поймаете рост CR на 0,4 п.п.

- Множественные сравнения. 10 метрик × 10 сегментов = 100 тестов; при $\alpha = 0,05$ ожидаемо 5 ложных срабатываний. Нужна поправка Бонферрони или FDR.

- Игнорирование практической значимости. p = 0,04 при росте CR на 0,05 п.п. может не окупить разработку.

- Смещение выборки. Если тест запущен только на лояльных клиентах, результат не масштабируется на всех.

- Преждевременная остановка по времени, а не по размеру выборки.

Связанные термины

- A/B-тестирование — практическое применение проверки гипотез.

- Доверительный интервал — диапазон, в котором с заданной вероятностью лежит истинный эффект.

- Статистическая мощность — вероятность обнаружить реальный эффект (обычно ≥ 80%).

- Ошибка I рода (α) — ложное отклонение H₀.

- Ошибка II рода (β) — пропуск реального эффекта.

- MDE (Minimum Detectable Effect) — минимальный эффект, который тест способен поймать.

- Байесовский вывод — альтернативный подход без p-value.

- Sequential testing — метод, позволяющий безопасно смотреть на данные во время теста.