Définition
Le test d'hypothèses (hypothesis testing) est une méthode d'inférence statistique qui permet de trancher, à partir de données échantillonnées, entre deux affirmations opposées concernant une population entière. En DTC, on ne teste jamais « tout le monde » : on teste un échantillon de visiteurs, de commandes ou d'abonnés, puis on généralise avec un niveau de confiance mesuré.
Concrètement, on formule deux hypothèses :
- H₀ (hypothèse nulle) : pas d'effet, pas de différence. Ex. le nouveau bouton d'ajout au panier convertit autant que l'ancien.
- H₁ (hypothèse alternative) : il y a un effet. Ex. le nouveau bouton convertit davantage.
Le test calcule la probabilité d'observer un écart au moins aussi grand que celui mesuré, si H₀ était vraie. Cette probabilité, c'est la p-value. Si elle passe sous un seuil α (souvent 0,05), on rejette H₀.
Analogie e-commerce
Imaginez un test A/B sur votre page produit :
- Version A (contrôle) : 4 200 visiteurs, 252 ajouts au panier → taux de 6,00 %
- Version B (variante) : 4 150 visiteurs, 291 ajouts au panier → taux de 7,01 %
L'écart brut est de +1,01 point de pourcentage. Mais est-ce un vrai signal ou du bruit ? Un test d'hypothèses répond à cette question : « Si les deux versions se valaient réellement, quelle est la probabilité d'observer un tel écart par simple hasard ? » Si cette probabilité est faible (p < 0,05), on considère l'écart comme réel et on déploie la variante.
C'est exactement le réflexe d'un bon growth manager : ne jamais scaler une campagne sur une intuition, mais sur un test qui tient statistiquement la route.
Formules clés
Statistique de test (proportion, grand échantillon) :
$$z = \frac{\hat{p}_B - \hat{p}_A}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A}+\frac{1}{n_B}\right)}}$$
avec $\hat{p} = \frac{x_A + x_B}{n_A + n_B}$ (taux poolé).
Application aux chiffres ci-dessus :
- $\hat{p}_A = 0{,}0600$, $\hat{p}_B = 0{,}0701$
- $\hat{p} = \frac{252+291}{4200+4150} = \frac{543}{8350} = 0{,}0650$
- Erreur standard : $\sqrt{0{,}0650 \times 0{,}9350 \times (1/4200 + 1/4150)} \approx 0{,}0054$
- $z = \frac{0{,}0101}{0{,}0054} \approx 1{,}87$
Pour un test bilatéral à α = 0,05, la valeur critique est 1,96. Ici z = 1,87 < 1,96 → on ne rejette pas H₀. La variante n'est pas encore significative.
Taille d'échantillon requise (par bras) :
$$n = \frac{2 \times (z_{1-\alpha/2} + z_{1-\beta})^2 \times p(1-p)}{\Delta^2}$$
Pour détecter un lift de 1 point sur une base de 6 % avec puissance 80 % : n ≈ 8 900 visiteurs par bras. Vos 4 150 ne suffisent pas.
Tableau comparatif des tests
| Test | Usage DTC typique | Condition | Exemple de métrique |
|---|---|---|---|
| **Test z de proportion** | Test A/B sur taux de conversion | n > 1 000 par bras | CVR panier |
| **Test t de Student** | Comparer un panier moyen | Variable continue, n < 30 possible | AOV (panier moyen) |
| **Test du chi²** | Lien entre 2 variables catégorielles | Effectifs ≥ 5 par cellule | Segment × taux de retour |
| **ANOVA** | Comparer 3+ variantes créatives | ≥ 3 groupes indépendants | ROAS de 4 audiences |
| **Test de Mann-Whitney** | Métriques non normales | Distributions asymétriques | Temps passé sur site |
Règle pratique : dès que vous testez un taux (conversion, clic, churn), partez sur un test z ou chi². Dès que vous testez une moyenne (panier, LTV, marge), partez sur un test t.
Applications concrètes en DTC
1. Optimisation du tunnel checkout : tester un formulaire en 2 étapes vs 1 étape. Sur 12 000 sessions, un lift de CVR de 6,0 % à 7,0 % représente environ +120 commandes sur la période, soit un impact direct sur le CA.
2. Créatives publicitaires Meta/TikTok : comparer le ROAS de deux hooks. Un test t sur les revenus par utilisateur exposé permet de trancher entre deux vidéos sans se fier au « feeling ».
3. Pricing et bundles : vérifier qu'une remise de 15 % génère réellement plus de marge qu'une remise de 10 %, en tenant compte du volume additionnel. Un test d'hypothèses sur la marge unitaire évite de brader pour rien.
4. Email & rétention : tester l'impact d'un objet personnalisé sur le taux d'ouverture. Sur une base de 50 000 abonnés, un lift de 2 points est détectable avec une puissance élevée.
5. Segmentation CRM : vérifier si le taux de retour produit diffère significativement entre deux cohorts d'acquisition — un chi² suffit.
Erreurs fréquentes
- Arrêter le test trop tôt : regarder la p-value tous les jours et stopper dès qu'elle passe sous 0,05 gonfle le taux de faux positifs (peeking). Fixez la durée à l'avance.
- Confondre significativité et importance : avec 500 000 visiteurs, un lift de 0,1 point peut être significatif… mais sans intérêt business.
- Multiplier les tests sans correction : tester 10 variantes à α = 0,05 donne ~40 % de chances de trouver un faux positif. Utilisez une correction de Bonferroni ou de Benjamini-Hochberg.
- Ignorer la puissance statistique : un test sous-dimensionné (n trop faible) ne détectera jamais un effet réel. Calculez la taille d'échantillon avant de lancer.
- Mal définir H₀ : en DTC, on teste souvent unilatéralement (« la variante fait mieux »), ce qui change la valeur critique et doit être décidé avant le test.
- Négliger la saisonnalité : un test lancé le Black Friday n'est pas comparable à une semaine de février. Randomisez sur la même fenêtre temporelle.
Termes liés
- P-value : probabilité d'observer les données si H₀ est vraie.
- Puissance statistique (1-β) : probabilité de détecter un effet réel. Cible : ≥ 80 %.
- Intervalle de confiance : fourchette plausible de l'effet réel, plus informatif que la seule p-value.
- Test A/B : application opérationnelle du test d'hypothèses en marketing.
- Erreur de type I / II : faux positif / faux négatif.
- MDE (Minimum Detectable Effect) : plus petit effet détectable avec la taille d'échantillon disponible.
- Bayesian A/B testing : alternative qui donne directement la probabilité qu'une variante soit meilleure.
À retenir : en DTC, le test d'hypothèses n'est pas un exercice académique — c'est le garde-fou qui empêche de scaler une fausse bonne idée et de brûler du budget média sur du bruit statistique.