ZHENESJAKOTHVIRUFRAR

Predictive Analytics

Definición

El Análisis Predictivo es la rama de la analítica avanzada que utiliza datos históricos, modelos estadísticos y algoritmos de *machine learning* para estimar la probabilidad de eventos futuros. En el contexto del e-commerce DTC (Direct-to-Consumer), no se trata de "adivinar", sino de calcular con un nivel de confianza medible qué hará un cliente, un producto o un canal en los próximos días, semanas o meses.

A diferencia del análisis descriptivo (¿qué pasó?) o del diagnóstico (¿por qué pasó?), el predictivo responde a la pregunta clave del negocio: ¿qué va a pasar y con qué probabilidad? El resultado típico es un *score* (0–1), una clasificación o un valor numérico proyectado que alimenta decisiones automáticas o semiautomáticas.

Analogía: el meteorólogo de tu tienda

Piensa en el análisis predictivo como un meteorólogo aplicado a tu negocio. Un meteorólogo no controla la lluvia, pero con datos de presión, humedad y viento puede decir: "hay un 78% de probabilidad de tormenta mañana a las 18:00". Tú decides si sales con paraguas o cancelas el picnic.

En DTC ocurre igual: el modelo no obliga al cliente a comprar, pero te avisa con antelación de que este usuario tiene un 82% de probabilidad de abandonar el carrito o que este SKU se agotará en 9 días. La decisión (enviar un cupón, reabastecer stock, subir el precio) sigue siendo tuya, pero deja de ser a ciegas.

Fórmula base

La mayoría de modelos predictivos en e-commerce se apoyan en una función de probabilidad condicional. Para un evento binario (compra / no compra, churn / no churn), la forma canónica es la regresión logística:

$$

P(Y=1 \mid X) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \beta_n x_n)}}

$$

Donde:

- $Y=1$ es el evento que queremos predecir (p. ej., conversión).

- $x_1 \dots x_n$ son las variables (recencia, frecuencia, valor monetario, sesiones, tiempo en sitio).

- $\beta$ son los coeficientes aprendidos por el modelo.

Para predicción de valor continuo (LTV, demanda), se usa regresión lineal o *gradient boosting*:

$$

\hat{y} = f(x_1, x_2, \dots, x_n) + \varepsilon

$$

El error $\varepsilon$ se minimiza típicamente con MSE:

$$

MSE = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{y}_i)^2

$$

Comparativa: descriptivo vs. predictivo vs. prescriptivo

Tipo de analíticaPregunta que respondeEjemplo DTCHerramienta típicaHorizonte temporal
Descriptiva¿Qué pasó?"El ROAS de Meta fue 2,4 en marzo"Looker Studio, GA4Pasado
Diagnóstica¿Por qué pasó?"El ROAS cayó por fatiga creativa"Análisis de cohortesPasado
**Predictiva****¿Qué pasará?****"Este cliente tiene 76% de probabilidad de recomprar en 30 días"****XGBoost, regresión logística****Futuro cercano (1–90 días)**
Prescriptiva¿Qué hago?"Enviar email con 15% dto. a este segmento"Optimización, banditsFuturo + acción

Aplicaciones concretas en DTC

1. Predicción de churn (abandono). Un modelo entrenado con datos de los últimos 12 meses identifica clientes con alta probabilidad de no volver. Caso real: una marca de suplementos en España redujo el churn mensual del 8,7% al 5,2% en 6 meses activando campañas de retención solo sobre el 20% de usuarios con score > 0,7.

2. Predicción de demanda e inventario. Predecir unidades vendidas por SKU y semana evita roturas de stock y exceso de capital inmovilizado. Ejemplo: una marca de cosmética natural pasó de un *stockout rate* del 11% a un 3,4% usando Prophet + variables de estacionalidad y campañas.

3. Predicción de LTV (Customer Lifetime Value). Permite decidir cuánto puedes pagar por adquirir un cliente (CAC máximo). Si el LTV predicho a 12 meses es €142 y tu margen bruto es 60%, tu CAC objetivo no debería superar €85 para mantener un ratio LTV/CAC ≥ 3.

4. Propensión de compra y next best action. Modelos que puntúan a cada visitante en tiempo real y deciden si mostrar un pop-up, un cupón o nada. Mejora típica en conversión: +12% a +28% en tests A/B bien diseñados.

5. Predicción de devoluciones. En moda, anticipar qué pedidos tienen alta probabilidad de devolución permite ofrecer guías de talla o seguros, reduciendo la tasa de retorno del 24% al 18%.

Errores frecuentes

- Confundir correlación con causalidad. Un modelo puede detectar que los usuarios que ven la página de "envíos" compran más, pero eso no significa que forzar esa visita aumente ventas.

- Ignorar el *data leakage*. Incluir variables que no estarán disponibles en el momento de la predicción (p. ej., el importe final del pedido para predecir si el pedido se completará) infla la precisión y arruina el modelo en producción.

- Sobreajustar con demasiadas variables. Un modelo con 200 features y 500 registros memoriza en lugar de generalizar. Mejor empezar con 8–12 variables y validar con *cross-validation*.

- No monitorizar el *drift*. El comportamiento del consumidor cambia (temporadas, competencia, algoritmos de Meta/Google). Un modelo sin reentrenamiento trimestral pierde precisión rápido.

- Olvidar el coste del error. Un falso positivo en churn (cliente que iba a quedarse pero recibe descuento) cuesta margen. Un falso negativo (cliente que se va sin retención) cuesta LTV. El umbral de decisión debe elegirse por impacto económico, no por accuracy.

Términos relacionados

- Machine Learning: motor técnico que aprende patrones sin reglas explícitas.

- Regresión logística: modelo base para clasificación binaria.

- Random Forest / XGBoost: algoritmos de *ensemble* muy usados en e-commerce por su robustez.

- Cohort Analysis: segmentación temporal que alimenta features predictivas.

- RFM (Recency, Frequency, Monetary): inputs clásicos para modelos de propensión.

- LTV (Lifetime Value): objetivo frecuente de predicción.

- Churn Rate: métrica que los modelos predictivos buscan reducir.

- Feature Engineering: arte de convertir datos crudos en variables útiles.

- A/B Testing: validación empírica de las acciones derivadas de la predicción.

- MLOps: disciplina para desplegar y mantener modelos en producción.