ZHENESJAKOTHVIRUFRAR

Hypothesis Testing

Definición

El contraste de hipótesis (o *hypothesis testing*) es un procedimiento estadístico que permite tomar decisiones sobre una población a partir de los datos de una muestra. En lugar de medir a todos los clientes, pedidos o visitas de tu tienda online, formulas dos hipótesis contrapuestas y dejas que los datos hablen:

- H₀ (hipótesis nula): no hay efecto, no hay diferencia, todo sigue igual.

- H₁ (hipótesis alternativa): hay un efecto, una diferencia o una mejora real.

El resultado no es un "sí" o "no" absoluto, sino una probabilidad: el p-valor. Si ese valor cae por debajo de tu umbral (habitualmente α = 0,05), rechazas H₀ y consideras el hallazgo estadísticamente significativo.

En ecommerce esto se traduce en decisiones como: *¿realmente el nuevo checkout convierte más?, ¿el email con emojis en el asunto abre más?, ¿el envío gratis a partir de 30 € sube el ticket medio?*


Analogía: el juicio del funnel

Imagina que tu embudo de conversión es un tribunal. H₀ es la presunción de inocencia: "la nueva landing no cambia nada". Tú, como analista, eres el fiscal y necesitas pruebas (datos de sesiones, clics, add-to-carts) para convencer al jurado de que sí hay una diferencia.

- Si las pruebas son débiles → no rechazas H₀ → mantienes la landing antigua.

- Si las pruebas son sólidas (p < 0,05) → rechazas H₀ → implementas la nueva.

Pero cuidado: un jurado puede condenar a un inocente (error Tipo I, falso positivo) o absolver a un culpable (error Tipo II, falso negativo). En DTC, un falso positivo es lanzar una variante que en realidad no mejora nada; un falso negativo es descartar una mejora real por falta de tráfico.


Fórmulas clave

1. Z-score para medias (muestra grande, σ conocida):

$$Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}$$

2. T-score para medias (σ desconocida):

$$t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}}$$

3. Test de proporciones (conversión CVR):

$$Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}$$

4. Tamaño de muestra mínimo por variante:

$$n = \frac{2 \cdot (Z_{\alpha/2} + Z_\beta)^2 \cdot p(1-p)}{\Delta^2}$$

Donde Δ es el uplift mínimo detectable (MDE) que te importa comercialmente.

Ejemplo real: tu CVR actual es 2,4 % (p = 0,024). Quieres detectar un uplift del 15 % relativo (Δ = 0,0036) con potencia 80 % y α = 0,05. Necesitarías aproximadamente n ≈ 28.500 sesiones por variante. Menos tráfico que eso y estarás lanzando decisiones al azar.


Tabla comparativa: Test A/B vs. Contraste clásico

AspectoTest A/B (ecommerce)Contraste de hipótesis clásico
ObjetivoMaximizar CVR / AOV / LTVValidar una afirmación sobre μ o p
H₀ típicaCVR_A = CVR_Bμ = μ₀
H₁ típicaCVR_B > CVR_A (unilateral)μ ≠ μ₀ (bilateral)
Umbral habitualα = 0,05, potencia 80 %α = 0,05 o 0,01
Métrica de decisiónp-valor + uplift + IC 95 %p-valor + IC
Riesgo principalPeeking, SRM, estacionalidadSupuestos de normalidad
HerramientasGA4, Optimizely, VWO, AB TastyR, Python (scipy), Excel
Duración mínima1–2 semanas completasDepende de n calculado

Aplicación en DTC / ecommerce

1. Test de precio. Subes el precio de un producto de 29,90 € a 32,90 € en el 50 % del tráfico. Mides CVR y AOV. Con 12.400 sesiones por variante obtienes CVR de 2,1 % vs. 1,8 % (p = 0,03). Rechazas H₀: la subida reduce conversión de forma significativa, aunque el AOV sube un 10 %. Decisión: mantener precio original si el margen por pedido cae.

2. Asunto de email. Envías dos asuntos a 8.000 suscriptores cada uno. Apertura del 22,4 % vs. 19,1 %. p = 0,008 → ganas el asunto con emoji, pero solo si el CTR y las ventas atribuidas acompañan.

3. Envío gratis threshold. Pruebas umbral de 30 € vs. 40 €. Ticket medio: 38,20 € vs. 41,50 €, pero CVR cae del 3,1 % al 2,6 %. El test te dice que la diferencia en CVR es significativa (p = 0,01), así que el umbral de 30 € gana en ingresos totales.

4. Creatividades en Meta Ads. Dos vídeos, 50.000 impresiones cada uno. CTR 1,42 % vs. 1,18 %. Con p = 0,04, escalas el ganador… pero revisa el ROAS a 7 días antes de mover presupuesto.


Errores comunes

- Espiar el test (peeking). Mirar el p-valor cada día infla el falso positivo. Define la duración antes de empezar.

- Parar al alcanzar significancia. Es la versión tóxica del peeking. Usa siempre el n calculado.

- Ignorar la potencia. Un test con 500 sesiones no detecta un uplift del 10 %. Potencia < 80 % = decisiones ciegas.

- Confundir significancia estadística con relevancia comercial. Un uplift del 0,1 % puede ser significativo con 1M de sesiones y no mover la aguja del P&L.

- Múltiples métricas sin corrección. Si miras 10 KPIs, alguno saldrá significativo por azar. Aplica Bonferroni o define una métrica primaria.

- SRM (Sample Ratio Mismatch). Si esperabas 50/50 y obtienes 47/53, hay un bug de asignación. El test no es válido.

- No segmentar antes. Analizar por dispositivo, país o canal *a posteriori* genera falsos positivos. Pre-registra los segmentos.


Términos relacionados

- p-valor — probabilidad de observar los datos (o más extremos) si H₀ es cierta.

- Nivel de significancia (α) — umbral de rechazo, típicamente 0,05.

- Potencia estadística (1-β) — probabilidad de detectar un efecto real. Objetivo: ≥ 80 %.

- Error Tipo I / Tipo II — falso positivo / falso negativo.

- Intervalo de confianza (IC 95 %) — rango plausible del efecto real.

- Test A/B — aplicación operativa del contraste en experimentación web.

- MDE (Minimum Detectable Effect) — uplift mínimo que tu test puede captar con el tráfico disponible.

- Test t de Student / Test Z — pruebas paramétricas para medias y proporciones.

- ANOVA — contraste para comparar 3+ variantes simultáneamente.

- Test chi-cuadrado — para variables categóricas (ej.: método de pago vs. conversión).

- Bayesian A/B testing — alternativa que reporta probabilidad de ser mejor, no p-valores.

Dominar el contraste de hipótesis es lo que separa al ecommercer que *intuye* del que *decide con datos*. En DTC, donde cada punto de CVR vale dinero real, la diferencia entre un test bien diseñado y uno mal interpretado puede ser de miles de euros al mes.