定義
仮説検定とは、サンプル(標本)データをもとに、母集団に関する仮説が妥当かどうかを統計的に判断する手法です。DTC・EC業界では、ABテストの結果判定、CVR改善施策の効果検証、CRMセグメント間のLTV差の有意性チェックなど、あらゆる意思決定の土台として使われます。
たとえば「新しいLPに変えたらCVRが上がった」という観察は、単なる偶然のブレ(ノイズ)かもしれません。仮説検定は、その差が統計的に有意かどうかを、p値や信頼区間を用いて定量的に評価します。
类比:居酒屋の「飲み比べ」で考える
仮説検定は、居酒屋で日本酒の飲み比べをする状況に似ています。
- 帰無仮説(H₀):「AとBの味に違いはない」=どちらも同じ味
- 対立仮説(H₁):「AとBの味には違いがある」
- サンプル:実際に飲んだ数口の味
- 有意水準(α):0.05=「20回に1回は間違えても許容する」という基準
数口飲んだだけで「これは違う!」と判断するのはリスクがあります。逆に何杯も飲めば確信は高まる。仮説検定はこの「何杯飲めば確信できるか」を数学的に決める作業です。
公式
1. z検定(母分散既知・大標本)
$$
z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}
$$
2. t検定(母分散未知・小標本)
$$
t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}}
$$
3. 2標本の比率検定(ABテストで最頻出)
$$
z = \frac{\hat{p}_A - \hat{p}_B}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}
$$
ここで:
- $\bar{x}$:標本平均
- $\mu_0$:帰無仮説の母平均
- $s$:標本標準偏差
- $n$:サンプルサイズ
- $\hat{p}$:統合した比率
具体例:既存LPのCVRが3.0%、新LPのCVRが3.6%、各群のサンプルサイズが10,000の場合:
$$
z = \frac{0.036 - 0.030}{\sqrt{0.033 \times 0.967 \times \left(\frac{1}{10000} + \frac{1}{10000}\right)}} \approx 2.34
$$
z = 2.34 は有意水準5%(両側検定、臨界値1.96)を超えるため、「新LPはCVRを有意に改善した」と判断できます。
対比表:主要な検定手法の使い分け
| 検定手法 | 用途 | データ型 | サンプル条件 | EC実務での例 |
|---|---|---|---|---|
| z検定 | 平均の比較 | 連続 | n ≥ 30 | 平均注文額(AOV)の比較 |
| t検定(1標本) | 平均 vs 基準値 | 連続 | n < 30 | 新規顧客の平均LTV vs 目標値 |
| t検定(2標本) | 2群の平均比較 | 連続 | 小〜中規模 | 会員ランク別の購買頻度差 |
| 比率検定 | 2群のCVR比較 | 二値 | 大規模 | ABテストのCVR検証 |
| カイ二乗検定 | 独立性の検証 | カテゴリ | 任意 | 流入チャネルと購入有無の関連 |
| ANOVA | 3群以上の平均比較 | 連続 | 任意 | 5つの広告クリエイティブのROAS比較 |
応用シーン:DTC/ECでの実践
1. ABテストの判定
新商品ページのCVRが既存比で+0.6pt(3.0% → 3.6%)改善。サンプル各10,000でp値 = 0.019 < 0.05 なら、本番反映の意思決定を下せます。
2. メール施策の効果検証
休眠顧客5,000人を2群に分け、クーポンあり群の復帰率が12.4%、なし群が9.8%。比率検定で有意差を確認し、ROIを試算。
3. 価格感度テスト
3つの価格帯(2,980円 / 3,480円 / 3,980円)でCVRとAOVをANOVA検定。3,480円が最も売上貢献が高いと統計的に裏付け。
4. チャネル別ROAS比較
Meta広告とGoogle広告のROAS差が1.8 vs 2.3。t検定で有意差を確認し、予算配分を最適化。
よくある誤解
❌ 誤解1:「p < 0.05なら効果がある」
p値は「帰無仮説が正しいときにこのデータが観測される確率」であり、効果の大きさ(実務的有意性)は別問題。CVR +0.01ptでもnが大きければ有意になります。
❌ 誤解2:「有意でなければ効果ゼロ」
「差がない」ではなく「差を検出できなかった」だけ。サンプル不足や検出力(Power)不足の可能性を必ず確認しましょう。目安としてPower ≥ 0.80を確保。
❌ 誤解3:「途中で結果を見てOK」
ABテストのピーキング(Peeking) は偽陽性を激増させます。事前にサンプルサイズと期間を固定し、途中で判断しないのが鉄則。
❌ 誤解4:「多重比較を無視」
5つのセグメントで同時に検定すると、少なくとも1つが偽陽性になる確率は約23%。Bonferroni補正などで有意水準を調整しましょう。
❌ 誤解5:「相関=因果」
検定で有意差が出ても、交絡因子が存在する可能性があります。可能ならRCT(ランダム化比較試験) を設計。
関連用語
- p値(p-value):帰無仮説のもとで観測データ以上の極端な結果が得られる確率
- 有意水準(α):棄却の閾値、慣例的に0.05または0.01
- 検出力(Power):真の効果を検出できる確率、1−β
- 信頼区間(CI):母数の推定範囲、95% CIが一般的
- 効果量(Effect Size):Cohen's d、相対リフトなど
- サンプルサイズ設計:検出力分析による事前計算
- 多重比較補正:Bonferroni、Benjamini-Hochberg法
- ベイズ検定:p値を使わない代替アプローチ
仮説検定は「なんとなく良さそう」を「統計的に言える」に変える強力な武器です。ただし、ビジネス判断はp値だけでなく、効果量・コスト・実装難易度を総合して行うことが、DTC/ECグロースの鍵となります。