ZHENESJAKOTHVIRUFRAR

P-value

Определение

P-значение — это вероятность получить наблюдаемый или более экстремальный результат при условии, что нулевая гипотеза (H₀) верна. Простыми словами: это мера того, насколько данные «не вписываются» в предположение об отсутствии эффекта.

В контексте DTC-аналитики P-значение отвечает на вопрос: *«Если мой новый креатив/лендинг/email на самом деле не лучше старого, какова вероятность увидеть такую разницу в конверсии случайно?»*

Чем меньше P-значение, тем сильнее доказательства против H₀. Порог значимости (α) обычно устанавливают на уровне 0.05, иногда 0.01 или 0.10 — в зависимости от риска и объёма трафика.

**Важно:** P-значение — это НЕ вероятность того, что H₀ верна. Это вероятность данных при условии H₀.

Аналогия из e-commerce

Представьте, что вы запускаете два варианта посадочной страницы:

- A (контроль): текущая страница, CR = 3.2%

- B (тест): новая страница, CR = 3.8%

Разница есть — но она может быть случайной. P-значение = 0.03 означает: *если бы обе страницы реально конвертили одинаково (3.2%), то увидеть разницу ≥0.6 п.п. можно было бы только в 3 случаях из 100.*

Это как проверка монеты: если после 100 бросков выпало 60 «орлов», P-значение покажет, насколько это отклонение объяснимо случайностью при честной монете.


Формула

Для z-теста пропорций (самый частый кейс в DTC):

$$

z = \frac{\hat{p}_B - \hat{p}_A}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}

$$

где:

- $\hat{p}_A, \hat{p}_B$ — конверсии в группах A и B

- $\hat{p}$ — объединённая конверсия: $\frac{x_A + x_B}{n_A + n_B}$

- $n_A, n_B$ — размеры выборок

Далее P-значение (двустороннее):

$$

p = 2 \cdot (1 - \Phi(|z|))

$$

где $\Phi$ — функция стандартного нормального распределения.

Пример расчёта:

ПараметрГруппа AГруппа B
Визиты (n)12 00012 500
Конверсии (x)384475
CR3.20%3.80%

- $\hat{p} = \frac{384+475}{12000+12500} = 0.03502$

- $z \approx 2.51$

- $p \approx 0.012$

Вывод: разница статистически значима при α = 0.05.


Сравнение: P-value vs. другие метрики

МетрикаЧто показываетКогда использовать в DTC
**P-value**Вероятность данных при H₀Быстрая проверка значимости A/B-теста
**Confidence Level**1 − p (например, 95%)Презентация результатов стейкхолдерам
**Effect Size**Абсолютная/относительная разницаОценка бизнес-импакта (lift в ₽)
**Statistical Power**Вероятность обнаружить реальный эффектПланирование размера выборки
**Confidence Interval**Диапазон истинного эффектаБолее информативен, чем p-value
В DTC-командах принято смотреть **и на p-value, и на доверительный интервал, и на uplift в деньгах**. P-value без оценки размера эффекта — плохая практика.

Применение в DTC/электронной коммерции

1. A/B-тесты креативов в Meta Ads / TikTok Ads

- Сравнение CTR, CVR, ROAS между вариантами объявлений.

- Пример: 3 варианта видео, p = 0.04 у победителя → масштабируем.

2. Тесты email-рассылок

- Open Rate 22% vs 25% при n = 8 000 на группу → p = 0.008 → внедряем новый subject line.

3. Оптимизация checkout

- Убрали одно поле → CR вырос с 4.1% до 4.6% (n = 20 000). p = 0.02 → раскатываем на 100% трафика.

4. Проверка гипотез по когортам

- LTV клиентов из канала X vs Y. P-value помогает не гнаться за случайными колебаниями.

5. Персонализация на сайте

- Динамические блоки рекомендаций: тест показывает p = 0.12 → недостаточно данных, продолжаем.


Частые ошибки

ОшибкаПочему это проблема
«p = 0.05 значит H₀ верна с вероятностью 5%»Неверная интерпретация: p — про данные, не про гипотезу
Остановка теста при первом p < 0.05Peeking искажает результат, растёт false positive rate
Игнорирование размера выборкиПри малом n даже большой lift не даст значимости
P-value без effect sizeСтатистическая значимость ≠ практическая ценность
Множественные сравнения без поправки20 тестов → ожидаем 1 ложноположительный при α = 0.05
Использование p-value для сегментов post-hocData dredging — почти гарантированный false positive
Путаница одностороннего и двустороннего тестаМеняет порог и интерпретацию

Связанные термины

- Нулевая гипотеза (H₀) — предположение об отсутствии эффекта

- Альтернативная гипотеза (H₁) — предположение о наличии эффекта

- Уровень значимости (α) — порог для отклонения H₀

- Доверительный интервал — диапазон оценки эффекта

- Statistical Power (1 − β) — вероятность обнаружить реальный эффект

- A/B-тест — основной инструмент проверки гипотез в DTC

- Multiple Testing Correction — поправки Бонферрони, Benjamini-Hochberg

- Bayesian A/B Testing — альтернатива с вероятностью превосходства варианта

- Sample Size Calculator — расчёт необходимого объёма выборки до старта теста