ZHENESJAKOTHVIRUFRAR

Predictive Analytics

Définition

L'analyse prédictive (ou *predictive analytics*) désigne l'ensemble des techniques statistiques, du machine learning et de la modélisation probabiliste qui permettent d'anticiper des comportements, des tendances ou des événements futurs à partir de données historiques et actuelles.

Dans un contexte DTC (Direct-to-Consumer) ou e-commerce, elle répond à une question centrale : *"Que va faire mon client ensuite, et comment puis-je le préparer ?"*

Contrairement à l'analyse descriptive (qui explique ce qui s'est passé) ou à l'analyse diagnostique (qui explique pourquoi), l'analyse prédictive projette l'information vers l'avant. Elle alimente ensuite l'analyse prescriptive, qui recommande l'action optimale.


Analogie

Imaginez un sommelier expérimenté. Il n'a pas besoin de goûter un vin pour savoir qu'un millésime 2020 en Bourgogne, après un été chaud et sec, sera fruité et structuré. Il croise :

- des données historiques (millésimes passés, notes de dégustation),

- des variables contextuelles (météo, rendement, cépage),

- un modèle mental affiné par l'expérience.

L'analyse prédictive, c'est ce sommelier — mais industrialisé, appliqué à des millions de clients simultanément, avec une précision mesurable et reproductible.


Formules clés

Régression linéaire multiple (prédiction de valeur client / LTV) :

ŷ = β₀ + β₁x₁ + β₂x₂ + ... + βₙxₙ + ε

Probabilité d'achat (régression logistique) :

P(y=1|x) = 1 / (1 + e^-(β₀ + β₁x₁ + ... + βₙxₙ))

Score de propension (RFM pondéré) :

Score = w_R · R_score + w_F · F_score + w_M · M_score

Churn prediction (modèle de survie simplifié) :

S(t) = P(T > t) = e^(-λt)

Où λ représente le taux de churn instantané, t le temps depuis le dernier achat.


Tableau comparatif : 4 familles d'analyse

Type d'analyseQuestion poséeHorizonExemple DTCOutils typiques
DescriptiveQue s'est-il passé ?PasséCA du mois dernierGA4, Looker
DiagnostiquePourquoi ?PasséChute du taux de conversion mobileSQL, cohortes
**Prédictive****Que va-t-il se passer ?****Futur****Probabilité de rachat sous 60 j****Python, Prophet, XGBoost**
PrescriptiveQue faire ?FuturOffrir -15 % à J+45 pour retenirOptimisation, bandits manchots

Applications concrètes en DTC / e-commerce

1. Scoring de propension à l'achat (purchase propensity)

Un modèle entraîné sur les sessions, événements et historiques d'achat attribue à chaque visiteur une probabilité de conversion entre 0 et 1. Sur un site mode français, on observe typiquement :

- taux de conversion moyen : 1,8 %

- top décile de propension : 12 à 18 % de conversion

- uplift email ciblé vs. massif : +34 % de ROAS

2. Prédiction de churn (attrition)

Pour un abonnement box beauté à 29 €/mois, un modèle de survie identifie les clients à risque dès la 2ᵉ échéance. Action : séquence de rétention à J-7. Résultat observé : -22 % de churn sur le segment ciblé.

3. Prévision de la demande (demand forecasting)

Indispensable pour piloter les stocks. Un modèle Prophet ou ARIMA sur 18 mois d'historique permet de réduire :

- ruptures de stock : -40 %

- surstocks saisonniers : -25 %

- coût de portage : -15 %

4. Prédiction de la LTV (Customer Lifetime Value)

Utile pour arbitrer le CAC acceptable. Si LTV prédite = 180 € et marge brute = 60 %, le CAC cible raisonnable se situe autour de 54 € (ratio LTV/CAC = 3).

5. Next Best Action / Next Best Offer

Recommandation produit personnalisée basée sur la similarité comportementale. Sur un pure player français, cela génère en moyenne +18 % de panier moyen sur les sessions ciblées.

6. Détection de fraude et abus promotionnels

Modèle supervisé sur les patterns de commande. Réduit les chargebacks de 30 à 50 % dans les verticales à risque (électronique, sneakers).


Erreurs fréquentes

1. Confondre corrélation et causalité. Un modèle prédit, il n'explique pas. Une prédiction juste ne justifie pas une décision marketing sans test causal (A/B test).

2. Négliger la dérive du modèle (data drift). Un modèle entraîné sur 2022 peut être obsolète en 2024. Prévoir un ré-entraînement trimestriel minimum.

3. Sur-optimiser la précision au détriment du business. Un modèle à 92 % d'accuracy peut être inutile si la classe positive est rare. Privilégier le lift, le AUC-ROC et le gain métier.

4. Ignorer le RGPD et le consentement. En France, toute prédiction basée sur des données personnelles doit reposer sur une base légale claire (intérêt légitime, consentement). Attention aux décisions automatisées (art. 22 RGPD).

5. Sous-estimer la qualité des données. Garbage in, garbage out. 70 % du temps d'un projet prédictif se passe en nettoyage et feature engineering.

6. Confondre prédiction et prophétie. Un modèle donne une probabilité, pas une certitude. Toujours communiquer un intervalle de confiance.

7. Oublier le coût d'inférence. Un modèle trop lourd tue la latence en temps réel (recommandation on-site). Préférer des modèles légers en production.


Termes liés

- Machine Learning (Apprentissage automatique) — socle technique de la plupart des modèles prédictifs.

- Analyse prescriptive — étape suivante : recommander l'action optimale.

- Scoring RFM — segmentation classique souvent utilisée comme input.

- Churn / Attrition — probabilité qu'un client cesse d'acheter.

- Customer Lifetime Value (LTV) — valeur future prédite d'un client.

- Propension d'achat — probabilité de conversion individuelle.

- Feature Engineering — construction des variables explicatives.

- AUC-ROC / Lift — métriques d'évaluation d'un modèle de classification.

- Data Drift — dégradation d'un modèle due à l'évolution des données.

- Test A/B — validation causale d'une décision issue d'un modèle prédictif.


À retenir : en DTC, l'analyse prédictive n'a de valeur que si elle déclenche une action mesurable. Un modèle qui prédit sans déclencher d'email, d'offre ou d'arbitrage stock est un coût, pas un actif.