Définition
Le Machine Learning (ML), ou *apprentissage automatique*, désigne l'ensemble des méthodes permettant à un algorithme d'extraire automatiquement des régularités à partir de données historiques, puis d'utiliser ces régularités pour prédire, classer ou optimiser une décision sur de nouvelles données. Contrairement à un programme classique où le développeur code explicitement les règles (« si panier > 80 € alors frais de port offerts »), le ML apprend ces règles lui-même à partir d'exemples.
En e-commerce et en DTC, on l'utilise pour répondre à des questions concrètes : *Quel client va churner ? Quel produit recommander à cet acheteur ? Quel est le CAC probable d'une campagne Meta ? Quel stock prévoir pour le Black Friday ?*
L'analogie du sommelier
Imaginez un sommelier qui goûte 10 000 bouteilles étiquetées par des experts. Au début, il se trompe souvent. Mais à force de comparer les caractéristiques (cépage, région, millésime, tanins) aux notes obtenues, il finit par détecter un motif : « un Pinot Noir de Bourgogne 2018 avec ce taux d'acidité vaut en moyenne 8,5/10 ». Il ne connaît pas la règle chimique exacte — il l'a inférée des données.
Le ML fonctionne pareil : on ne lui donne pas la règle, on lui donne des exemples étiquetés (features + target) et il trouve la fonction qui relie les deux. Ensuite, face à une bouteille inconnue (nouvelle donnée), il prédit la note.
Formule
Un modèle de ML cherche à minimiser une fonction de perte sur l'ensemble d'entraînement :
$$
\hat{y} = f_\theta(x) \quad \text{avec} \quad \theta^* = \arg\min_\theta \frac{1}{N} \sum_{i=1}^{N} L(y_i, f_\theta(x_i))
$$
Où :
- $x_i$ = vecteur de features (ex. : panier moyen, ancienneté, nb de sessions)
- $y_i$ = variable cible (ex. : achat oui/non, LTV, churn)
- $f_\theta$ = le modèle paramétré par $\theta$
- $L$ = perte (MSE pour la régression, log-loss pour la classification)
Exemple concret en DTC : prédire la LTV à 12 mois. Si le modèle atteint une erreur absolue moyenne (MAE) de 18 € sur une LTV moyenne de 140 €, soit ~13 % d'erreur — c'est exploitable pour piloter le budget acquisition.
Tableau comparatif des familles d'algorithmes
| Famille | Principe | Forces | Limites | Cas DTC typique |
|---|---|---|---|---|
| **Régression linéaire / logistique** | Frontière ou droite de décision | Rapide, interprétable | Sous-apprend les relations non-linéaires | Scoring de propension d'achat simple |
| **Arbres & forêts (Random Forest, XGBoost)** | Combinaison d'arbres de décision | Très performant sur données tabulaires | Boîte noire, overfitting si mal réglé | Prédiction de churn, détection de fraude COD |
| **Réseaux de neurones (Deep Learning)** | Couches de transformations non-linéaires | Capte signaux complexes (image, texte) | Gourmand en données et GPU | Recommandation visuelle, NLP SAV |
| **Clustering (K-means, DBSCAN)** | Regroupement par similarité | Non supervisé, segmentation | Choix de K arbitraire | Segmentation RFM clients |
| **Reinforcement Learning** | Apprentissage par récompense | Optimisation séquentielle | Coûteux, instable | Enchères publicitaires dynamiques |
Applications en e-commerce / DTC
1. Recommandation produit : Amazon attribue ~35 % de ses revenus au moteur de reco. Un DTC mode peut viser +12 % d'AOV en affichant « Souvent acheté avec ».
2. Prédiction de churn : un modèle XGBoost identifie les clients à risque 30 jours avant qu'ils disparaissent. Sur une base de 50 000 clients, cibler les 10 % les plus à risque avec un email de réactivation peut récupérer 2 à 4 % de rétention additionnelle.
3. Détection de fraude : sur les paiements COD (cash on delivery), un modèle réduit les colis refusés de 8 % à 3 % — sur 20 000 commandes/mois à 45 € de panier, c'est ~45 000 € de logistique sauvée annuellement.
4. Prévision de stock : prévoir la demande par SKU à J+30 pour éviter rupture et surstock. Un bon modèle réduit le surstock de 15-20 %.
5. Pricing dynamique : ajuster les prix en temps réel selon élasticité, stock et concurrence.
6. Attribution marketing : modèles multi-touch pour répartir le budget entre Meta, Google, TikTok, influence.
Erreurs fréquentes
- Confondre corrélation et causalité : le modèle prédit, il n'explique pas. Un modèle qui prédit le churn ne dit pas *pourquoi* le client part.
- Data leakage : inclure une feature qui contient l'information du futur (ex. : « nombre de remboursements » pour prédire un churn déjà survenu). Résultat : 99 % en test, 0 % en prod.
- Overfitting : le modèle apprend le bruit. Toujours valider sur un jeu *hold-out* (ex. : 70/15/15 train/val/test).
- Négliger le déséquilibre de classes : 2 % de churners → accuracy de 98 % en prédisant « personne ne churn ». Utilisez plutôt le AUC-ROC ou le F1-score.
- Ignorer le drift : les comportements changent (post-COVID, iOS 14.5, hausse du CAC). Un modèle non réentraîné perd 20-30 % de performance en 6 mois.
- Sacrifier l'interprétabilité : en Europe, le RGPD (art. 22) impose un droit à l'explication pour les décisions automatisées. SHAP ou LIME deviennent obligatoires.
Termes liés
- Features / Feature engineering : transformation des données brutes en variables exploitables.
- Supervised vs Unsupervised Learning : avec ou sans étiquettes.
- Train / Validation / Test split : découpage des données pour évaluer honnêtement.
- Overfitting / Underfitting : les deux ennemis du data scientist.
- MLOps : industrialisation du cycle de vie des modèles (versioning, monitoring, retraining).
- AUC-ROC, RMSE, MAE : métriques d'évaluation.
- AutoML : automatisation du choix de modèle et d'hyperparamètres — utile pour les équipes DTC sans data scientist dédié.
- IA générative : sous-domaine du ML (LLM, diffusion) qui produit du contenu — à distinguer du ML prédictif classique.