ZHENESJAKOTHVIRUFRAR

Hypothesis Testing

Définition

Le test d'hypothèses (hypothesis testing) est une méthode d'inférence statistique qui permet de trancher, à partir de données échantillonnées, entre deux affirmations opposées concernant une population entière. En DTC, on ne teste jamais « tout le monde » : on teste un échantillon de visiteurs, de commandes ou d'abonnés, puis on généralise avec un niveau de confiance mesuré.

Concrètement, on formule deux hypothèses :

- H₀ (hypothèse nulle) : pas d'effet, pas de différence. Ex. le nouveau bouton d'ajout au panier convertit autant que l'ancien.

- H₁ (hypothèse alternative) : il y a un effet. Ex. le nouveau bouton convertit davantage.

Le test calcule la probabilité d'observer un écart au moins aussi grand que celui mesuré, si H₀ était vraie. Cette probabilité, c'est la p-value. Si elle passe sous un seuil α (souvent 0,05), on rejette H₀.

Analogie e-commerce

Imaginez un test A/B sur votre page produit :

- Version A (contrôle) : 4 200 visiteurs, 252 ajouts au panier → taux de 6,00 %

- Version B (variante) : 4 150 visiteurs, 291 ajouts au panier → taux de 7,01 %

L'écart brut est de +1,01 point de pourcentage. Mais est-ce un vrai signal ou du bruit ? Un test d'hypothèses répond à cette question : « Si les deux versions se valaient réellement, quelle est la probabilité d'observer un tel écart par simple hasard ? » Si cette probabilité est faible (p < 0,05), on considère l'écart comme réel et on déploie la variante.

C'est exactement le réflexe d'un bon growth manager : ne jamais scaler une campagne sur une intuition, mais sur un test qui tient statistiquement la route.

Formules clés

Statistique de test (proportion, grand échantillon) :

$$z = \frac{\hat{p}_B - \hat{p}_A}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A}+\frac{1}{n_B}\right)}}$$

avec $\hat{p} = \frac{x_A + x_B}{n_A + n_B}$ (taux poolé).

Application aux chiffres ci-dessus :

- $\hat{p}_A = 0{,}0600$, $\hat{p}_B = 0{,}0701$

- $\hat{p} = \frac{252+291}{4200+4150} = \frac{543}{8350} = 0{,}0650$

- Erreur standard : $\sqrt{0{,}0650 \times 0{,}9350 \times (1/4200 + 1/4150)} \approx 0{,}0054$

- $z = \frac{0{,}0101}{0{,}0054} \approx 1{,}87$

Pour un test bilatéral à α = 0,05, la valeur critique est 1,96. Ici z = 1,87 < 1,96 → on ne rejette pas H₀. La variante n'est pas encore significative.

Taille d'échantillon requise (par bras) :

$$n = \frac{2 \times (z_{1-\alpha/2} + z_{1-\beta})^2 \times p(1-p)}{\Delta^2}$$

Pour détecter un lift de 1 point sur une base de 6 % avec puissance 80 % : n ≈ 8 900 visiteurs par bras. Vos 4 150 ne suffisent pas.

Tableau comparatif des tests

TestUsage DTC typiqueConditionExemple de métrique
**Test z de proportion**Test A/B sur taux de conversionn > 1 000 par brasCVR panier
**Test t de Student**Comparer un panier moyenVariable continue, n < 30 possibleAOV (panier moyen)
**Test du chi²**Lien entre 2 variables catégoriellesEffectifs ≥ 5 par celluleSegment × taux de retour
**ANOVA**Comparer 3+ variantes créatives≥ 3 groupes indépendantsROAS de 4 audiences
**Test de Mann-Whitney**Métriques non normalesDistributions asymétriquesTemps passé sur site

Règle pratique : dès que vous testez un taux (conversion, clic, churn), partez sur un test z ou chi². Dès que vous testez une moyenne (panier, LTV, marge), partez sur un test t.

Applications concrètes en DTC

1. Optimisation du tunnel checkout : tester un formulaire en 2 étapes vs 1 étape. Sur 12 000 sessions, un lift de CVR de 6,0 % à 7,0 % représente environ +120 commandes sur la période, soit un impact direct sur le CA.

2. Créatives publicitaires Meta/TikTok : comparer le ROAS de deux hooks. Un test t sur les revenus par utilisateur exposé permet de trancher entre deux vidéos sans se fier au « feeling ».

3. Pricing et bundles : vérifier qu'une remise de 15 % génère réellement plus de marge qu'une remise de 10 %, en tenant compte du volume additionnel. Un test d'hypothèses sur la marge unitaire évite de brader pour rien.

4. Email & rétention : tester l'impact d'un objet personnalisé sur le taux d'ouverture. Sur une base de 50 000 abonnés, un lift de 2 points est détectable avec une puissance élevée.

5. Segmentation CRM : vérifier si le taux de retour produit diffère significativement entre deux cohorts d'acquisition — un chi² suffit.

Erreurs fréquentes

- Arrêter le test trop tôt : regarder la p-value tous les jours et stopper dès qu'elle passe sous 0,05 gonfle le taux de faux positifs (peeking). Fixez la durée à l'avance.

- Confondre significativité et importance : avec 500 000 visiteurs, un lift de 0,1 point peut être significatif… mais sans intérêt business.

- Multiplier les tests sans correction : tester 10 variantes à α = 0,05 donne ~40 % de chances de trouver un faux positif. Utilisez une correction de Bonferroni ou de Benjamini-Hochberg.

- Ignorer la puissance statistique : un test sous-dimensionné (n trop faible) ne détectera jamais un effet réel. Calculez la taille d'échantillon avant de lancer.

- Mal définir H₀ : en DTC, on teste souvent unilatéralement (« la variante fait mieux »), ce qui change la valeur critique et doit être décidé avant le test.

- Négliger la saisonnalité : un test lancé le Black Friday n'est pas comparable à une semaine de février. Randomisez sur la même fenêtre temporelle.

Termes liés

- P-value : probabilité d'observer les données si H₀ est vraie.

- Puissance statistique (1-β) : probabilité de détecter un effet réel. Cible : ≥ 80 %.

- Intervalle de confiance : fourchette plausible de l'effet réel, plus informatif que la seule p-value.

- Test A/B : application opérationnelle du test d'hypothèses en marketing.

- Erreur de type I / II : faux positif / faux négatif.

- MDE (Minimum Detectable Effect) : plus petit effet détectable avec la taille d'échantillon disponible.

- Bayesian A/B testing : alternative qui donne directement la probabilité qu'une variante soit meilleure.

À retenir : en DTC, le test d'hypothèses n'est pas un exercice académique — c'est le garde-fou qui empêche de scaler une fausse bonne idée et de brûler du budget média sur du bruit statistique.