ZHENESJAKOTHVIRUFRAR

Machine Learning

Définition

Le Machine Learning (ML), ou *apprentissage automatique*, désigne l'ensemble des méthodes permettant à un algorithme d'extraire automatiquement des régularités à partir de données historiques, puis d'utiliser ces régularités pour prédire, classer ou optimiser une décision sur de nouvelles données. Contrairement à un programme classique où le développeur code explicitement les règles (« si panier > 80 € alors frais de port offerts »), le ML apprend ces règles lui-même à partir d'exemples.

En e-commerce et en DTC, on l'utilise pour répondre à des questions concrètes : *Quel client va churner ? Quel produit recommander à cet acheteur ? Quel est le CAC probable d'une campagne Meta ? Quel stock prévoir pour le Black Friday ?*

L'analogie du sommelier

Imaginez un sommelier qui goûte 10 000 bouteilles étiquetées par des experts. Au début, il se trompe souvent. Mais à force de comparer les caractéristiques (cépage, région, millésime, tanins) aux notes obtenues, il finit par détecter un motif : « un Pinot Noir de Bourgogne 2018 avec ce taux d'acidité vaut en moyenne 8,5/10 ». Il ne connaît pas la règle chimique exacte — il l'a inférée des données.

Le ML fonctionne pareil : on ne lui donne pas la règle, on lui donne des exemples étiquetés (features + target) et il trouve la fonction qui relie les deux. Ensuite, face à une bouteille inconnue (nouvelle donnée), il prédit la note.

Formule

Un modèle de ML cherche à minimiser une fonction de perte sur l'ensemble d'entraînement :

$$

\hat{y} = f_\theta(x) \quad \text{avec} \quad \theta^* = \arg\min_\theta \frac{1}{N} \sum_{i=1}^{N} L(y_i, f_\theta(x_i))

$$

Où :

- $x_i$ = vecteur de features (ex. : panier moyen, ancienneté, nb de sessions)

- $y_i$ = variable cible (ex. : achat oui/non, LTV, churn)

- $f_\theta$ = le modèle paramétré par $\theta$

- $L$ = perte (MSE pour la régression, log-loss pour la classification)

Exemple concret en DTC : prédire la LTV à 12 mois. Si le modèle atteint une erreur absolue moyenne (MAE) de 18 € sur une LTV moyenne de 140 €, soit ~13 % d'erreur — c'est exploitable pour piloter le budget acquisition.

Tableau comparatif des familles d'algorithmes

FamillePrincipeForcesLimitesCas DTC typique
**Régression linéaire / logistique**Frontière ou droite de décisionRapide, interprétableSous-apprend les relations non-linéairesScoring de propension d'achat simple
**Arbres & forêts (Random Forest, XGBoost)**Combinaison d'arbres de décisionTrès performant sur données tabulairesBoîte noire, overfitting si mal régléPrédiction de churn, détection de fraude COD
**Réseaux de neurones (Deep Learning)**Couches de transformations non-linéairesCapte signaux complexes (image, texte)Gourmand en données et GPURecommandation visuelle, NLP SAV
**Clustering (K-means, DBSCAN)**Regroupement par similaritéNon supervisé, segmentationChoix de K arbitraireSegmentation RFM clients
**Reinforcement Learning**Apprentissage par récompenseOptimisation séquentielleCoûteux, instableEnchères publicitaires dynamiques

Applications en e-commerce / DTC

1. Recommandation produit : Amazon attribue ~35 % de ses revenus au moteur de reco. Un DTC mode peut viser +12 % d'AOV en affichant « Souvent acheté avec ».

2. Prédiction de churn : un modèle XGBoost identifie les clients à risque 30 jours avant qu'ils disparaissent. Sur une base de 50 000 clients, cibler les 10 % les plus à risque avec un email de réactivation peut récupérer 2 à 4 % de rétention additionnelle.

3. Détection de fraude : sur les paiements COD (cash on delivery), un modèle réduit les colis refusés de 8 % à 3 % — sur 20 000 commandes/mois à 45 € de panier, c'est ~45 000 € de logistique sauvée annuellement.

4. Prévision de stock : prévoir la demande par SKU à J+30 pour éviter rupture et surstock. Un bon modèle réduit le surstock de 15-20 %.

5. Pricing dynamique : ajuster les prix en temps réel selon élasticité, stock et concurrence.

6. Attribution marketing : modèles multi-touch pour répartir le budget entre Meta, Google, TikTok, influence.

Erreurs fréquentes

- Confondre corrélation et causalité : le modèle prédit, il n'explique pas. Un modèle qui prédit le churn ne dit pas *pourquoi* le client part.

- Data leakage : inclure une feature qui contient l'information du futur (ex. : « nombre de remboursements » pour prédire un churn déjà survenu). Résultat : 99 % en test, 0 % en prod.

- Overfitting : le modèle apprend le bruit. Toujours valider sur un jeu *hold-out* (ex. : 70/15/15 train/val/test).

- Négliger le déséquilibre de classes : 2 % de churners → accuracy de 98 % en prédisant « personne ne churn ». Utilisez plutôt le AUC-ROC ou le F1-score.

- Ignorer le drift : les comportements changent (post-COVID, iOS 14.5, hausse du CAC). Un modèle non réentraîné perd 20-30 % de performance en 6 mois.

- Sacrifier l'interprétabilité : en Europe, le RGPD (art. 22) impose un droit à l'explication pour les décisions automatisées. SHAP ou LIME deviennent obligatoires.

Termes liés

- Features / Feature engineering : transformation des données brutes en variables exploitables.

- Supervised vs Unsupervised Learning : avec ou sans étiquettes.

- Train / Validation / Test split : découpage des données pour évaluer honnêtement.

- Overfitting / Underfitting : les deux ennemis du data scientist.

- MLOps : industrialisation du cycle de vie des modèles (versioning, monitoring, retraining).

- AUC-ROC, RMSE, MAE : métriques d'évaluation.

- AutoML : automatisation du choix de modèle et d'hyperparamètres — utile pour les équipes DTC sans data scientist dédié.

- IA générative : sous-domaine du ML (LLM, diffusion) qui produit du contenu — à distinguer du ML prédictif classique.