ZHENESJAKOTHVIRUFRAR

Sample Size

¿Qué es el tamaño de la muestra?

El tamaño de la muestra es el número de individuos, registros o unidades de observación que se incluyen en un experimento, encuesta o test. En el contexto del eCommerce y las tiendas DTC (Direct-to-Consumer), se traduce en una pregunta muy concreta: ¿a cuántas personas necesito exponer a mi test A/B, a mi encuesta de satisfacción o a mi campaña de email para poder confiar en los resultados?

No se trata de un detalle técnico menor. Un tamaño de muestra mal calculado puede hacer que tomes decisiones de negocio equivocadas: cambiar el color de un botón porque "ganó" en un test con 40 visitas, o descartar una landing que en realidad funcionaba, pero que se midió con demasiado ruido.

En analítica digital, el tamaño de la muestra determina dos cosas fundamentales:

- La precisión de tus estimaciones (cuánto se aleja tu resultado del valor real).

- La potencia estadística para detectar un efecto real cuando existe.


Una analogía para entenderlo

Imagina que quieres saber si la nueva salsa picante de tu marca gusta más que la original. No puedes hacer que la prueben los 50.000 clientes de tu base de datos. Pero tampoco puedes preguntar solo a tu socio y a tu primo: sus opiniones no representan a nadie más.

El tamaño de la muestra es como servir cucharadas de una olla gigante para saber si está bien sazonada. Si pruebas una cucharada, puedes tener mala suerte y caer en un trozo sin sal. Si pruebas 30 cucharadas repartidas por toda la olla, tu veredicto será mucho más fiable. La clave está en cuántas cucharadas necesitas para estar seguro, sin tener que comerte la olla entera.


Fórmula básica

Para una proporción (por ejemplo, tasa de conversión), la fórmula clásica es:

n = (Z² × p × (1 - p)) / E²

Donde:

- n = tamaño de la muestra necesario

- Z = valor crítico según el nivel de confianza (1,96 para 95%)

- p = proporción esperada (ej. 0,05 = 5% de conversión)

- E = margen de error aceptable (ej. 0,02 = ±2%)

Ejemplo práctico: Quieres medir tu tasa de conversión con un 95% de confianza y ±2% de error, esperando un 5% de conversión:

n = (1,96² × 0,05 × 0,95) / 0,02²
n = (3,8416 × 0,0475) / 0,0004
n = 0,1825 / 0,0004
n ≈ 456

Necesitas al menos 456 visitas para esa medición.

Para comparar dos variantes (test A/B), la fórmula se ajusta y suele requerir más muestra por rama, ya que necesitas detectar una diferencia entre grupos, no solo estimar un valor.


Comparativa de escenarios según tamaño de muestra

EscenarioTamaño de muestraMargen de error aprox.¿Decisión fiable?
Test A/B con 100 visitas por rama100±10%No, demasiado ruido
Test A/B con 1.000 visitas por rama1.000±3%Aceptable para efectos grandes
Test A/B con 10.000 visitas por rama10.000±1%Sí, detecta efectos pequeños
Encuesta NPS con 200 respuestas200±7%Orientativo, no definitivo
Encuesta NPS con 1.000 respuestas1.000±3%Fiable para segmentos amplios

Aplicación en DTC y eCommerce

1. Tests A/B de landing pages

Si tu landing convierte al 4% y quieres detectar una mejora hasta el 4,5% (un +12,5% relativo), necesitarás varios miles de visitas por variante. Con 500 visitas no verás nada aunque la mejora sea real.

2. Encuestas post-compra

Para medir satisfacción por país o por categoría de producto, necesitas mínimo 100 respuestas por segmento si quieres comparar segmentos entre sí. Menos de eso, las diferencias suelen ser casualidad.

3. Campañas de email

Si quieres testear asuntos (subject lines) con una tasa de apertura del 20%, necesitas alrededor de 1.500 envíos por variante para detectar diferencias de 3 puntos porcentuales con confianza del 95%.

4. Análisis de cohortes y retención

Para calcular la retención a 90 días con precisión, necesitas que cada cohorte mensual tenga al menos 200-300 clientes. Cohortes de 30 clientes generan curvas que suben y bajan sin sentido.


Errores comunes

1. Parar el test cuando "ya va ganando". Esto infla los falsos positivos. El tamaño de la muestra se calcula antes de empezar y se respeta hasta el final.

2. Confundir tamaño de muestra con tráfico total. En un A/B test, el tráfico se divide entre variantes. Si necesitas 5.000 por rama, necesitas 10.000 visitas totales.

3. Ignorar el tamaño del efecto. Cuanto más pequeño sea el efecto que quieres detectar, más muestra necesitas. Detectar un +1% requiere muchísima más muestra que detectar un +20%.

4. Usar muestras de conveniencia. Los primeros 100 visitantes de un día no representan a tu audiencia: pueden ser de un solo país, de una sola fuente de tráfico o de una franja horaria concreta.

5. No ajustar por múltiples comparaciones. Si testeas 10 variantes a la vez, el riesgo de falso positivo se multiplica. Necesitas más muestra o correcciones estadísticas.

6. Olvidar la estacionalidad. Una muestra recogida en Black Friday no representa el comportamiento de un martes de marzo.


Términos relacionados

- Potencia estadística (Power): probabilidad de detectar un efecto real. Lo habitual es exigir un 80%.

- Nivel de confianza: probabilidad de que el intervalo contenga el valor real. Estándar: 95%.

- Margen de error: amplitud del intervalo de confianza. A menor margen, mayor muestra.

- Test A/B: experimento controlado donde el tamaño de muestra determina la validez.

- Significancia estadística (p-value): probabilidad de observar el resultado si no hubiera efecto real.

- Intervalo de confianza: rango donde probablemente está el valor verdadero.

- Población vs. muestra: la población es todo tu universo de clientes; la muestra es el subconjunto que mides.


Conclusión

El tamaño de la muestra no es un número que se elige al azar: es la garantía matemática de que tus decisiones de negocio se basan en señales reales y no en ruido. En DTC, donde cada punto de conversión mueve ingresos, calcularlo bien antes de lanzar un test es la diferencia entre escalar con datos o escalar con intuiciones.