ZHENESJAKOTHVIRUFRAR

P-value

P-value (Valeur p) : le juge de paix de vos tests A/B en e-commerce

Définition

La p-value (ou valeur p) est la probabilité d’observer un résultat au moins aussi extrême que celui que vous avez mesuré, en supposant que l’hypothèse nulle (H₀) soit vraie. En clair : c’est la probabilité que votre “effet” soit en réalité un simple coup de chance.

En DTC / e-commerce, on l’utilise partout : tests A/B sur les landing pages, taux de conversion, panier moyen, taux de clic sur une créa Meta, etc. Une p-value faible (< 0,05) signifie que le résultat est statistiquement significatif — donc peu probable sous H₀.

⚠️ Attention : une p-value ne mesure pas la taille de l’effet, ni l’importance business. Elle dit juste : “Si H₀ était vraie, aurait-on pu voir ça ?”


Analogie : le détecteur de fumée

Imaginez que vous testez une nouvelle page produit. H₀ = “la nouvelle page ne change rien au taux de conversion”. Votre p-value, c’est comme un détecteur de fumée :

- p-value = 0,03 → le détecteur sonne. Il y a 3 % de chances que ce niveau de fumée apparaisse naturellement (sans feu). Vous concluez : “il y a bien un feu” (effet significatif).

- p-value = 0,42 → le détecteur ne sonne pas. 42 % de chances que ce soit juste de la vapeur. Vous ne pouvez pas conclure.

Mais un détecteur peut être mal réglé : il peut sonner pour un toast brûlé (faux positif) ou rester muet devant un feu couvant (faux négatif). La p-value a exactement les mêmes limites.


Formule

Pour un test bilatéral classique (ex. test Z sur une proportion) :

\[

p = 2 \times P(Z > |z_{obs}|)

\]

avec :

\[

z_{obs} = \frac{\hat{p} - p_0}{\sqrt{\frac{p_0(1-p_0)}{n}}}

\]

- \(\hat{p}\) : taux de conversion observé

- \(p_0\) : taux de conversion sous H₀ (ex. 3,2 %)

- \(n\) : taille d’échantillon

Exemple concret DTC :

Vous testez une nouvelle page panier.

- Taux de conversion actuel : \(p_0 = 3,2\%\)

- Nouvelle page : \(\hat{p} = 3,8\%\) sur \(n = 12 500\) visiteurs

- \(z_{obs} \approx 2,14\)

- \(p \approx 0,032\)

→ p < 0,05 → significatif. Vous pouvez déployer.


Tableau comparatif : p-value vs autres indicateurs

IndicateurCe qu’il mesureSeuil courantUtilité DTC
**p-value**Probabilité sous H₀< 0,05Détecter un effet non dû au hasard
**Taille d’effet (lift)**Amplitude du gain> +5 %Impact business réel
**Puissance statistique**Probabilité de détecter un vrai effet> 80 %Éviter les faux négatifs
**Intervalle de confiance**Fourchette plausible95 %Vision plus riche que p seul
**ROI / marge**Gain net> 0Décision finale

👉 En DTC, on ne décide jamais sur la p-value seule. Un lift de +0,1 % avec p = 0,01 peut être significatif mais non rentable.


Applications concrètes en e-commerce

1. Test A/B sur le bouton “Ajouter au panier”

- Variante A : 4,1 % de conversion

- Variante B : 4,6 %

- n = 18 000 par bras

- p = 0,018 → significatif. Déploiement.

2. Créa Meta Ads

- Taux de clic A : 1,8 %

- Taux de clic B : 2,1 %

- p = 0,07 → non significatif. On continue le test.

3. Emailing abandon de panier

- Objet A : 12 % d’ouverture

- Objet B : 14 %

- p = 0,004 → très significatif. On garde B.

4. Prix psychologique

- 29,99 € vs 29,00 €

- p = 0,21 → pas de différence détectable. On garde le prix actuel.


Common pitfalls (pièges fréquents)

- Confondre p-value et probabilité que H₀ soit vraie.

p = 0,03 ne veut pas dire “3 % de chances que H₀ soit vraie”. C’est l’erreur la plus répandue.

- Arrêter un test trop tôt.

Regarder la p-value tous les jours augmente le risque de faux positif. Fixez la durée à l’avance (ex. 14 jours ou 10 000 visiteurs).

- Multiplier les tests sans correction.

Si vous testez 20 variantes, vous aurez ~64 % de chances de trouver un faux positif à p < 0,05. Utilisez Bonferroni ou Benjamini-Hochberg.

- Ignorer la taille d’échantillon.

Un p = 0,04 sur 200 visiteurs est fragile. Sur 50 000, il est solide.

- Prendre la p-value pour une preuve absolue.

Elle dépend du modèle, de la qualité des données, du biais de sélection.

- Négliger l’intervalle de confiance.

Un lift de +0,5 % avec IC95 % [-0,1 % ; +1,1 %] n’est pas exploitable, même si p = 0,049.


Termes liés

- Hypothèse nulle (H₀) : postulat “aucun effet”.

- Hypothèse alternative (H₁) : postulat “il y a un effet”.

- Seuil alpha (α) : risque de faux positif accepté (souvent 0,05).

- Puissance statistique (1-β) : probabilité de détecter un vrai effet.

- Taille d’effet : ampleur du changement (lift, Cohen’s d).

- Intervalle de confiance : fourchette de valeurs plausibles.

- Test unilatéral / bilatéral : direction ou non de l’effet.

- Correction de Bonferroni : ajustement pour tests multiples.

- False discovery rate (FDR) : proportion de faux positifs parmi les découvertes.

- Test séquentiel : méthode pour arrêter un test sans gonfler l’erreur.


En résumé pour votre DTC

La p-value est un outil de filtrage, pas une baguette magique.

- Utilisez-la avec la taille d’effet, l’IC et le ROI.

- Fixez vos règles avant le test.

- Ne surinterprétez jamais un p = 0,049.

- Et rappelez-vous : en e-commerce, un gain statistiquement significatif qui ne convertit pas en marge n’est qu’un chiffre de plus dans votre dashboard.