ZHENESJAKOTHVIRUFRAR

P-value

Definición

El valor p (o *p-value*) es la probabilidad de obtener un resultado igual o más extremo que el observado, asumiendo que la hipótesis nula (H₀) es verdadera. En el contexto del comercio electrónico directo al consumidor (DTC), se usa como herramienta clave para decidir si un cambio en la tienda, una campaña o un test A/B produce un efecto real o si, por el contrario, es fruto del azar.

Dicho de forma sencilla: el valor p responde a la pregunta *"si mi cambio no sirviera para nada, ¿qué probabilidad habría de ver una diferencia como la que estoy viendo?"*. Cuanto más pequeño sea ese valor, más evidencia tenemos contra la hipótesis nula.

Un umbral habitual en DTC es α = 0,05. Si p < 0,05, se rechaza H₀ y se declara el resultado como *estadísticamente significativo*.


Analogía para un negocio DTC

Imagina que lanzas una nueva página de producto para tu marca de cosmética natural. Antes, la conversión era del 3,2 %. Con la nueva página, durante 2 semanas, la conversión sube al 4,1 %.

Antes de celebrarlo, te preguntas: *"¿Y si esta subida fuera solo suerte?"*. El valor p es precisamente la probabilidad de ver una subida de 0,9 puntos porcentuales (o más) si la nueva página fuera igual de buena que la antigua. Si esa probabilidad es del 2 % (p = 0,02), tienes buenas razones para pensar que el cambio es real. Si fuera del 45 % (p = 0,45), probablemente estás viendo ruido.

Piensa en el valor p como el "nivel de sospecha" que necesitas superar para fiarte del resultado. No es la probabilidad de que tu hipótesis sea cierta, sino la probabilidad de los datos *bajo* la hipótesis nula.


Fórmula

Para un test de hipótesis típico sobre una media o proporción, el valor p se obtiene a partir del estadístico de contraste:

$$

Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}

$$

Donde:

- $\bar{x}$ = valor observado en la muestra (p. ej., tasa de conversión del test)

- $\mu_0$ = valor bajo la hipótesis nula (p. ej., tasa de conversión del control)

- $\sigma$ = desviación estándar poblacional (o muestral)

- $n$ = tamaño de la muestra

Para una prueba bilateral:

$$

p = 2 \cdot P(Z > |z_{obs}|)

$$

En tests A/B de conversión, se suele usar la prueba Z para proporciones:

$$

Z = \frac{\hat{p}_A - \hat{p}_B}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}

$$

donde $\hat{p}$ es la tasa de conversión combinada.


Tabla comparativa: interpretación del valor p

Valor pInterpretaciónDecisión típica en DTC
p < 0,01Evidencia muy fuerte contra H₀Escalar el cambio a toda la tienda
0,01 ≤ p < 0,05Evidencia sólidaImplementar, pero monitorizar
0,05 ≤ p < 0,10Evidencia débilRepetir el test con más tráfico
p ≥ 0,10Sin evidencia relevanteDescartar el cambio o rediseñar

Ejemplo con datos concretos:

- Test A/B en checkout: control convierte al 2,80 % (n = 12.400), variante al 3,35 % (n = 12.150).

- Diferencia absoluta: +0,55 pp, uplift relativo del +19,6 %.

- Estadístico Z ≈ 2,47 → valor p ≈ 0,0135.

- Conclusión: significativo al 5 %, no al 1 %. Se recomienda escalar con seguimiento.


Aplicaciones en DTC / E-commerce

1. Test A/B de páginas de producto: comparar tasas de conversión entre dos versiones. Un p < 0,05 indica que la variante merece implementarse.

2. Optimización de email marketing: medir si un asunto nuevo mejora la tasa de apertura. Ejemplo: apertura del 22,1 % vs 24,3 % con p = 0,03.

3. Precios y promociones: evaluar si un descuento del 15 % incrementa el ticket medio de forma significativa o solo canibaliza margen.

4. Retención y LTV: comparar cohorts de clientes suscritos vs no suscritos. Un p bajo confirma que la suscripción tiene impacto real en la recompra.

5. Publicidad pagada: validar si un creativo nuevo mejora el ROAS. Si p = 0,42, no hay evidencia para cambiar el creativo ganador.

6. Logística y envíos: testear si el envío gratis a partir de 40 € aumenta el AOV. Con p = 0,008, la decisión es clara.

En todos los casos, el valor p no sustituye al juicio de negocio: un resultado significativo pero con uplift del 0,1 % puede no compensar el coste de implementación.


Errores comunes

- Confundir p con la probabilidad de que H₀ sea cierta. El valor p es P(datos | H₀), no P(H₀ | datos).

- Usar p < 0,05 como dogma. En DTC con tráficos pequeños, umbrales más laxos o intervalos de confianza pueden ser más útiles.

- Ignorar el tamaño del efecto. Un p muy bajo con uplift del 0,05 % no es accionable.

- Hacer *p-hacking*: probar muchas variantes hasta que una salga significativa. Aumenta los falsos positivos.

- Parar el test antes de tiempo al ver p < 0,05. Infla la tasa de error tipo I.

- No corregir por comparaciones múltiples (Bonferroni, Benjamini-Hochberg) cuando se testean varias métricas a la vez.

- Confundir significación estadística con significación práctica. En e-commerce, lo que importa es el impacto en ingresos, no solo en p.


Términos relacionados

- Hipótesis nula (H₀) y hipótesis alternativa (H₁)

- Nivel de significación (α)

- Error tipo I (falso positivo) y error tipo II (falso negativo)

- Potencia estadística (1 − β)

- Intervalo de confianza (IC)

- Tamaño del efecto (effect size)

- Test A/B y test multivariante

- Test Z y test t de Student

- Corrección de Bonferroni

- MDE (Minimum Detectable Effect)

Dominar el valor p te permite tomar decisiones en tu tienda DTC basadas en evidencia, no en intuiciones. Pero recuerda: el p-value es una pieza del rompecabezas, junto con el tamaño del efecto, el contexto de negocio y la calidad de los datos.