Definición
El valor p (o *p-value*) es la probabilidad de obtener un resultado igual o más extremo que el observado, asumiendo que la hipótesis nula (H₀) es verdadera. En el contexto del comercio electrónico directo al consumidor (DTC), se usa como herramienta clave para decidir si un cambio en la tienda, una campaña o un test A/B produce un efecto real o si, por el contrario, es fruto del azar.
Dicho de forma sencilla: el valor p responde a la pregunta *"si mi cambio no sirviera para nada, ¿qué probabilidad habría de ver una diferencia como la que estoy viendo?"*. Cuanto más pequeño sea ese valor, más evidencia tenemos contra la hipótesis nula.
Un umbral habitual en DTC es α = 0,05. Si p < 0,05, se rechaza H₀ y se declara el resultado como *estadísticamente significativo*.
Analogía para un negocio DTC
Imagina que lanzas una nueva página de producto para tu marca de cosmética natural. Antes, la conversión era del 3,2 %. Con la nueva página, durante 2 semanas, la conversión sube al 4,1 %.
Antes de celebrarlo, te preguntas: *"¿Y si esta subida fuera solo suerte?"*. El valor p es precisamente la probabilidad de ver una subida de 0,9 puntos porcentuales (o más) si la nueva página fuera igual de buena que la antigua. Si esa probabilidad es del 2 % (p = 0,02), tienes buenas razones para pensar que el cambio es real. Si fuera del 45 % (p = 0,45), probablemente estás viendo ruido.
Piensa en el valor p como el "nivel de sospecha" que necesitas superar para fiarte del resultado. No es la probabilidad de que tu hipótesis sea cierta, sino la probabilidad de los datos *bajo* la hipótesis nula.
Fórmula
Para un test de hipótesis típico sobre una media o proporción, el valor p se obtiene a partir del estadístico de contraste:
$$
Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}
$$
Donde:
- $\bar{x}$ = valor observado en la muestra (p. ej., tasa de conversión del test)
- $\mu_0$ = valor bajo la hipótesis nula (p. ej., tasa de conversión del control)
- $\sigma$ = desviación estándar poblacional (o muestral)
- $n$ = tamaño de la muestra
Para una prueba bilateral:
$$
p = 2 \cdot P(Z > |z_{obs}|)
$$
En tests A/B de conversión, se suele usar la prueba Z para proporciones:
$$
Z = \frac{\hat{p}_A - \hat{p}_B}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}
$$
donde $\hat{p}$ es la tasa de conversión combinada.
Tabla comparativa: interpretación del valor p
| Valor p | Interpretación | Decisión típica en DTC |
|---|---|---|
| p < 0,01 | Evidencia muy fuerte contra H₀ | Escalar el cambio a toda la tienda |
| 0,01 ≤ p < 0,05 | Evidencia sólida | Implementar, pero monitorizar |
| 0,05 ≤ p < 0,10 | Evidencia débil | Repetir el test con más tráfico |
| p ≥ 0,10 | Sin evidencia relevante | Descartar el cambio o rediseñar |
Ejemplo con datos concretos:
- Test A/B en checkout: control convierte al 2,80 % (n = 12.400), variante al 3,35 % (n = 12.150).
- Diferencia absoluta: +0,55 pp, uplift relativo del +19,6 %.
- Estadístico Z ≈ 2,47 → valor p ≈ 0,0135.
- Conclusión: significativo al 5 %, no al 1 %. Se recomienda escalar con seguimiento.
Aplicaciones en DTC / E-commerce
1. Test A/B de páginas de producto: comparar tasas de conversión entre dos versiones. Un p < 0,05 indica que la variante merece implementarse.
2. Optimización de email marketing: medir si un asunto nuevo mejora la tasa de apertura. Ejemplo: apertura del 22,1 % vs 24,3 % con p = 0,03.
3. Precios y promociones: evaluar si un descuento del 15 % incrementa el ticket medio de forma significativa o solo canibaliza margen.
4. Retención y LTV: comparar cohorts de clientes suscritos vs no suscritos. Un p bajo confirma que la suscripción tiene impacto real en la recompra.
5. Publicidad pagada: validar si un creativo nuevo mejora el ROAS. Si p = 0,42, no hay evidencia para cambiar el creativo ganador.
6. Logística y envíos: testear si el envío gratis a partir de 40 € aumenta el AOV. Con p = 0,008, la decisión es clara.
En todos los casos, el valor p no sustituye al juicio de negocio: un resultado significativo pero con uplift del 0,1 % puede no compensar el coste de implementación.
Errores comunes
- Confundir p con la probabilidad de que H₀ sea cierta. El valor p es P(datos | H₀), no P(H₀ | datos).
- Usar p < 0,05 como dogma. En DTC con tráficos pequeños, umbrales más laxos o intervalos de confianza pueden ser más útiles.
- Ignorar el tamaño del efecto. Un p muy bajo con uplift del 0,05 % no es accionable.
- Hacer *p-hacking*: probar muchas variantes hasta que una salga significativa. Aumenta los falsos positivos.
- Parar el test antes de tiempo al ver p < 0,05. Infla la tasa de error tipo I.
- No corregir por comparaciones múltiples (Bonferroni, Benjamini-Hochberg) cuando se testean varias métricas a la vez.
- Confundir significación estadística con significación práctica. En e-commerce, lo que importa es el impacto en ingresos, no solo en p.
Términos relacionados
- Hipótesis nula (H₀) y hipótesis alternativa (H₁)
- Nivel de significación (α)
- Error tipo I (falso positivo) y error tipo II (falso negativo)
- Potencia estadística (1 − β)
- Intervalo de confianza (IC)
- Tamaño del efecto (effect size)
- Test A/B y test multivariante
- Test Z y test t de Student
- Corrección de Bonferroni
- MDE (Minimum Detectable Effect)
Dominar el valor p te permite tomar decisiones en tu tienda DTC basadas en evidencia, no en intuiciones. Pero recuerda: el p-value es una pieza del rompecabezas, junto con el tamaño del efecto, el contexto de negocio y la calidad de los datos.