Definición
El contraste de hipótesis (o *hypothesis testing*) es un procedimiento estadístico que permite tomar decisiones sobre una población a partir de los datos de una muestra. En lugar de medir a todos los clientes, pedidos o visitas de tu tienda online, formulas dos hipótesis contrapuestas y dejas que los datos hablen:
- H₀ (hipótesis nula): no hay efecto, no hay diferencia, todo sigue igual.
- H₁ (hipótesis alternativa): hay un efecto, una diferencia o una mejora real.
El resultado no es un "sí" o "no" absoluto, sino una probabilidad: el p-valor. Si ese valor cae por debajo de tu umbral (habitualmente α = 0,05), rechazas H₀ y consideras el hallazgo estadísticamente significativo.
En ecommerce esto se traduce en decisiones como: *¿realmente el nuevo checkout convierte más?, ¿el email con emojis en el asunto abre más?, ¿el envío gratis a partir de 30 € sube el ticket medio?*
Analogía: el juicio del funnel
Imagina que tu embudo de conversión es un tribunal. H₀ es la presunción de inocencia: "la nueva landing no cambia nada". Tú, como analista, eres el fiscal y necesitas pruebas (datos de sesiones, clics, add-to-carts) para convencer al jurado de que sí hay una diferencia.
- Si las pruebas son débiles → no rechazas H₀ → mantienes la landing antigua.
- Si las pruebas son sólidas (p < 0,05) → rechazas H₀ → implementas la nueva.
Pero cuidado: un jurado puede condenar a un inocente (error Tipo I, falso positivo) o absolver a un culpable (error Tipo II, falso negativo). En DTC, un falso positivo es lanzar una variante que en realidad no mejora nada; un falso negativo es descartar una mejora real por falta de tráfico.
Fórmulas clave
1. Z-score para medias (muestra grande, σ conocida):
$$Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}$$
2. T-score para medias (σ desconocida):
$$t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}}$$
3. Test de proporciones (conversión CVR):
$$Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}$$
4. Tamaño de muestra mínimo por variante:
$$n = \frac{2 \cdot (Z_{\alpha/2} + Z_\beta)^2 \cdot p(1-p)}{\Delta^2}$$
Donde Δ es el uplift mínimo detectable (MDE) que te importa comercialmente.
Ejemplo real: tu CVR actual es 2,4 % (p = 0,024). Quieres detectar un uplift del 15 % relativo (Δ = 0,0036) con potencia 80 % y α = 0,05. Necesitarías aproximadamente n ≈ 28.500 sesiones por variante. Menos tráfico que eso y estarás lanzando decisiones al azar.
Tabla comparativa: Test A/B vs. Contraste clásico
| Aspecto | Test A/B (ecommerce) | Contraste de hipótesis clásico |
|---|---|---|
| Objetivo | Maximizar CVR / AOV / LTV | Validar una afirmación sobre μ o p |
| H₀ típica | CVR_A = CVR_B | μ = μ₀ |
| H₁ típica | CVR_B > CVR_A (unilateral) | μ ≠ μ₀ (bilateral) |
| Umbral habitual | α = 0,05, potencia 80 % | α = 0,05 o 0,01 |
| Métrica de decisión | p-valor + uplift + IC 95 % | p-valor + IC |
| Riesgo principal | Peeking, SRM, estacionalidad | Supuestos de normalidad |
| Herramientas | GA4, Optimizely, VWO, AB Tasty | R, Python (scipy), Excel |
| Duración mínima | 1–2 semanas completas | Depende de n calculado |
Aplicación en DTC / ecommerce
1. Test de precio. Subes el precio de un producto de 29,90 € a 32,90 € en el 50 % del tráfico. Mides CVR y AOV. Con 12.400 sesiones por variante obtienes CVR de 2,1 % vs. 1,8 % (p = 0,03). Rechazas H₀: la subida reduce conversión de forma significativa, aunque el AOV sube un 10 %. Decisión: mantener precio original si el margen por pedido cae.
2. Asunto de email. Envías dos asuntos a 8.000 suscriptores cada uno. Apertura del 22,4 % vs. 19,1 %. p = 0,008 → ganas el asunto con emoji, pero solo si el CTR y las ventas atribuidas acompañan.
3. Envío gratis threshold. Pruebas umbral de 30 € vs. 40 €. Ticket medio: 38,20 € vs. 41,50 €, pero CVR cae del 3,1 % al 2,6 %. El test te dice que la diferencia en CVR es significativa (p = 0,01), así que el umbral de 30 € gana en ingresos totales.
4. Creatividades en Meta Ads. Dos vídeos, 50.000 impresiones cada uno. CTR 1,42 % vs. 1,18 %. Con p = 0,04, escalas el ganador… pero revisa el ROAS a 7 días antes de mover presupuesto.
Errores comunes
- Espiar el test (peeking). Mirar el p-valor cada día infla el falso positivo. Define la duración antes de empezar.
- Parar al alcanzar significancia. Es la versión tóxica del peeking. Usa siempre el n calculado.
- Ignorar la potencia. Un test con 500 sesiones no detecta un uplift del 10 %. Potencia < 80 % = decisiones ciegas.
- Confundir significancia estadística con relevancia comercial. Un uplift del 0,1 % puede ser significativo con 1M de sesiones y no mover la aguja del P&L.
- Múltiples métricas sin corrección. Si miras 10 KPIs, alguno saldrá significativo por azar. Aplica Bonferroni o define una métrica primaria.
- SRM (Sample Ratio Mismatch). Si esperabas 50/50 y obtienes 47/53, hay un bug de asignación. El test no es válido.
- No segmentar antes. Analizar por dispositivo, país o canal *a posteriori* genera falsos positivos. Pre-registra los segmentos.
Términos relacionados
- p-valor — probabilidad de observar los datos (o más extremos) si H₀ es cierta.
- Nivel de significancia (α) — umbral de rechazo, típicamente 0,05.
- Potencia estadística (1-β) — probabilidad de detectar un efecto real. Objetivo: ≥ 80 %.
- Error Tipo I / Tipo II — falso positivo / falso negativo.
- Intervalo de confianza (IC 95 %) — rango plausible del efecto real.
- Test A/B — aplicación operativa del contraste en experimentación web.
- MDE (Minimum Detectable Effect) — uplift mínimo que tu test puede captar con el tráfico disponible.
- Test t de Student / Test Z — pruebas paramétricas para medias y proporciones.
- ANOVA — contraste para comparar 3+ variantes simultáneamente.
- Test chi-cuadrado — para variables categóricas (ej.: método de pago vs. conversión).
- Bayesian A/B testing — alternativa que reporta probabilidad de ser mejor, no p-valores.
Dominar el contraste de hipótesis es lo que separa al ecommercer que *intuye* del que *decide con datos*. En DTC, donde cada punto de CVR vale dinero real, la diferencia entre un test bien diseñado y uno mal interpretado puede ser de miles de euros al mes.