ZHENESJAKOTHVIRUFRAR

Sample Size

Определение

Sample Size (размер выборки) — это количество наблюдений, пользователей или транзакций, которые вы включаете в эксперимент, опрос или A/B-тест. Простыми словами: это сколько людей должно увидеть вашу гипотезу, чтобы вы могли ей доверять.

В DTC-контексте размер выборки определяет, сможете ли вы отличить реальный эффект (например, рост конверсии на 0,5 п.п.) от случайного шума. Если выборка слишком маленькая — вы рискуете принять неверное решение: откатить работающую гипотезу или, наоборот, масштабировать убыточную.

Размер выборки напрямую влияет на:

- Статистическую значимость (p-value)

- Мощность теста (power) — способность обнаружить эффект, если он есть

- Ширину доверительного интервала

- Скорость принятия решений в команде growth


Аналогия

Представьте, что вы тестируете новый креатив для Facebook Ads. Вы запускаете его на аудиторию в 200 человек и видите CTR 3,2% против 2,8% у старого креатива. Радоваться? Не спешите.

Это как пробовать суп одной ложкой: если вам попался кусочек перца — суп кажется острым. Но вся кастрюля может быть пресной. Чем больше ложек вы попробуете (чем больше выборка), тем точнее поймёте реальный вкус.

В e-commerce то же самое: 200 пользователей — это одна ложка. 20 000 пользователей — это уже репрезентативная дегустация.


Формула

Базовая формула для расчёта размера выборки в A/B-тесте:

n = (Z² × p × (1 - p)) / E²

Где:

- n — необходимый размер выборки на одну группу

- Z — Z-значение для уровня доверия (1,96 для 95%)

- p — ожидаемая конверсия (в долях)

- E — допустимая погрешность (margin of error)

Для сравнения двух пропорций используется расширенная формула:

n = (Zα/2 + Zβ)² × (p1(1-p1) + p2(1-p2)) / (p1 - p2)²

Где:

- Zα/2 = 1,96 (для α = 0,05)

- Zβ = 0,84 (для мощности 80%)

- p1, p2 — конверсии контрольной и тестовой групп

Пример: базовая конверсия 3%, хотите поймать рост до 3,5%, мощность 80%, значимость 95%:

n = (1,96 + 0,84)² × (0,03×0,97 + 0,035×0,965) / (0,005)²
n ≈ 7,84 × 0,0629 / 0,000025
n ≈ 19 725 на группу

Итого: ~39 450 пользователей на оба варианта.


Сравнительная таблица

Размер выборкиПогрешность (±)МощностьРиск ложного решенияСрок теста (при 5k визитов/день)
500±4,4%~30%Очень высокий1 день
2 000±2,2%~55%Высокий2 дня
10 000±1,0%~80%Умеренный4 дня
40 000±0,5%~95%Низкий8 дней
100 000±0,3%~99%Минимальный20 дней

Чем больше выборка — тем уже доверительный интервал и выше точность. Но есть цена: время и трафик.


Применение в DTC и e-commerce

1. A/B-тесты на лендинге

Вы тестируете заголовок, CTA или цену. Без расчёта sample size легко остановить тест на 300 пользователях и принять ошибочное решение. Стандарт для DTC: минимум 10 000–20 000 сессий на вариант при базовой конверсии 2–4%.

2. Email-кампании

Open rate 18% vs 21%. Чтобы подтвердить разницу с мощностью 80%, нужно ~3 500 получателей на каждую группу.

3. Тесты креативов в paid social

CPM, CTR, ROAS. Для стабильных выводов по ROAS при дневном бюджете $500 нужно накопить минимум 7–14 дней и 50+ конверсий на вариант.

4. Опросы клиентов (NPS, CSAT)

Чтобы получить погрешность ±5% при доверительной вероятности 95%, нужно 384 респондента. Для ±3% — уже 1 067.

5. Тесты цен

Цена — самый чувствительный элемент. Здесь размер выборки критичен: даже 1% разницы в конверсии может дать +$10 000 выручки в месяц. Рекомендуется не менее 25 000 сессий на вариант.


Частые ошибки

1. Остановка теста слишком рано (peeking)

Вы смотрите результаты каждый день и останавливаетесь, как только видите «победителя». Это inflates false positive rate до 30–40%. Решение: фиксируйте sample size заранее и не подглядывайте.

2. Игнорирование baseline conversion

Чем ниже базовая конверсия, тем больше выборка нужна. При конверсии 0,5% для детекции роста до 0,6% потребуется ~150 000 пользователей на группу.

3. Недооценка сезонности

Тест на 2 000 пользователей в Чёрную пятницу не репрезентативен для обычного вторника. Учитывайте это при расчёте.

4. Игнорирование MDE (Minimum Detectable Effect)

Если вы хотите поймать рост конверсии на 0,1 п.п., выборка должна быть в 25 раз больше, чем для роста на 0,5 п.п.

5. Смешение трафика

Мобильные vs десктоп, новый vs возвращающийся пользователь. Если группы не сбалансированы, размер выборки не спасёт.

6. Расчёт только на одну группу

Формула даёт n на каждую группу. Для A/B-теста умножайте на 2, для A/B/C — на 3.


Связанные термины

- Statistical Significance — вероятность, что результат не случаен

- Statistical Power — вероятность обнаружить эффект, если он есть

- Confidence Interval — диапазон, в котором находится истинное значение

- MDE (Minimum Detectable Effect) — минимальный эффект, который тест способен поймать

- P-value — вероятность получить результат при условии, что нулевая гипотеза верна

- Type I / Type II Error — ложноположительный и ложноотрицательный результаты

- Sequential Testing — методология, позволяющая безопасно подглядывать в данные

- Bayesian A/B Testing — альтернативный подход, где sample size менее критичен


Итог

Sample Size — это фундамент любого эксперимента в DTC. Без него вы принимаете решения на основе шума, а не сигнала. Считайте выборку до запуска теста, фиксируйте её и не останавливайтесь раньше времени. Помните: лучше подождать 7 дней и получить надёжный результат, чем за 2 дня принять решение, которое сожжёт бюджет.