Определение
P-значение — это вероятность получить наблюдаемый или более экстремальный результат при условии, что нулевая гипотеза (H₀) верна. Простыми словами: это мера того, насколько данные «не вписываются» в предположение об отсутствии эффекта.
В контексте DTC-аналитики P-значение отвечает на вопрос: *«Если мой новый креатив/лендинг/email на самом деле не лучше старого, какова вероятность увидеть такую разницу в конверсии случайно?»*
Чем меньше P-значение, тем сильнее доказательства против H₀. Порог значимости (α) обычно устанавливают на уровне 0.05, иногда 0.01 или 0.10 — в зависимости от риска и объёма трафика.
**Важно:** P-значение — это НЕ вероятность того, что H₀ верна. Это вероятность данных при условии H₀.
Аналогия из e-commerce
Представьте, что вы запускаете два варианта посадочной страницы:
- A (контроль): текущая страница, CR = 3.2%
- B (тест): новая страница, CR = 3.8%
Разница есть — но она может быть случайной. P-значение = 0.03 означает: *если бы обе страницы реально конвертили одинаково (3.2%), то увидеть разницу ≥0.6 п.п. можно было бы только в 3 случаях из 100.*
Это как проверка монеты: если после 100 бросков выпало 60 «орлов», P-значение покажет, насколько это отклонение объяснимо случайностью при честной монете.
Формула
Для z-теста пропорций (самый частый кейс в DTC):
$$
z = \frac{\hat{p}_B - \hat{p}_A}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}
$$
где:
- $\hat{p}_A, \hat{p}_B$ — конверсии в группах A и B
- $\hat{p}$ — объединённая конверсия: $\frac{x_A + x_B}{n_A + n_B}$
- $n_A, n_B$ — размеры выборок
Далее P-значение (двустороннее):
$$
p = 2 \cdot (1 - \Phi(|z|))
$$
где $\Phi$ — функция стандартного нормального распределения.
Пример расчёта:
| Параметр | Группа A | Группа B |
|---|---|---|
| Визиты (n) | 12 000 | 12 500 |
| Конверсии (x) | 384 | 475 |
| CR | 3.20% | 3.80% |
- $\hat{p} = \frac{384+475}{12000+12500} = 0.03502$
- $z \approx 2.51$
- $p \approx 0.012$
Вывод: разница статистически значима при α = 0.05.
Сравнение: P-value vs. другие метрики
| Метрика | Что показывает | Когда использовать в DTC |
|---|---|---|
| **P-value** | Вероятность данных при H₀ | Быстрая проверка значимости A/B-теста |
| **Confidence Level** | 1 − p (например, 95%) | Презентация результатов стейкхолдерам |
| **Effect Size** | Абсолютная/относительная разница | Оценка бизнес-импакта (lift в ₽) |
| **Statistical Power** | Вероятность обнаружить реальный эффект | Планирование размера выборки |
| **Confidence Interval** | Диапазон истинного эффекта | Более информативен, чем p-value |
В DTC-командах принято смотреть **и на p-value, и на доверительный интервал, и на uplift в деньгах**. P-value без оценки размера эффекта — плохая практика.
Применение в DTC/электронной коммерции
1. A/B-тесты креативов в Meta Ads / TikTok Ads
- Сравнение CTR, CVR, ROAS между вариантами объявлений.
- Пример: 3 варианта видео, p = 0.04 у победителя → масштабируем.
2. Тесты email-рассылок
- Open Rate 22% vs 25% при n = 8 000 на группу → p = 0.008 → внедряем новый subject line.
3. Оптимизация checkout
- Убрали одно поле → CR вырос с 4.1% до 4.6% (n = 20 000). p = 0.02 → раскатываем на 100% трафика.
4. Проверка гипотез по когортам
- LTV клиентов из канала X vs Y. P-value помогает не гнаться за случайными колебаниями.
5. Персонализация на сайте
- Динамические блоки рекомендаций: тест показывает p = 0.12 → недостаточно данных, продолжаем.
Частые ошибки
| Ошибка | Почему это проблема |
|---|---|
| «p = 0.05 значит H₀ верна с вероятностью 5%» | Неверная интерпретация: p — про данные, не про гипотезу |
| Остановка теста при первом p < 0.05 | Peeking искажает результат, растёт false positive rate |
| Игнорирование размера выборки | При малом n даже большой lift не даст значимости |
| P-value без effect size | Статистическая значимость ≠ практическая ценность |
| Множественные сравнения без поправки | 20 тестов → ожидаем 1 ложноположительный при α = 0.05 |
| Использование p-value для сегментов post-hoc | Data dredging — почти гарантированный false positive |
| Путаница одностороннего и двустороннего теста | Меняет порог и интерпретацию |
Связанные термины
- Нулевая гипотеза (H₀) — предположение об отсутствии эффекта
- Альтернативная гипотеза (H₁) — предположение о наличии эффекта
- Уровень значимости (α) — порог для отклонения H₀
- Доверительный интервал — диапазон оценки эффекта
- Statistical Power (1 − β) — вероятность обнаружить реальный эффект
- A/B-тест — основной инструмент проверки гипотез в DTC
- Multiple Testing Correction — поправки Бонферрони, Benjamini-Hochberg
- Bayesian A/B Testing — альтернатива с вероятностью превосходства варианта
- Sample Size Calculator — расчёт необходимого объёма выборки до старта теста