ZHENESJAKOTHVIRUFRAR

Hypothesis Testing

定義

仮説検定とは、サンプル(標本)データをもとに、母集団に関する仮説が妥当かどうかを統計的に判断する手法です。DTC・EC業界では、ABテストの結果判定、CVR改善施策の効果検証、CRMセグメント間のLTV差の有意性チェックなど、あらゆる意思決定の土台として使われます。

たとえば「新しいLPに変えたらCVRが上がった」という観察は、単なる偶然のブレ(ノイズ)かもしれません。仮説検定は、その差が統計的に有意かどうかを、p値や信頼区間を用いて定量的に評価します。


类比:居酒屋の「飲み比べ」で考える

仮説検定は、居酒屋で日本酒の飲み比べをする状況に似ています。

- 帰無仮説(H₀):「AとBの味に違いはない」=どちらも同じ味

- 対立仮説(H₁):「AとBの味には違いがある」

- サンプル:実際に飲んだ数口の味

- 有意水準(α):0.05=「20回に1回は間違えても許容する」という基準

数口飲んだだけで「これは違う!」と判断するのはリスクがあります。逆に何杯も飲めば確信は高まる。仮説検定はこの「何杯飲めば確信できるか」を数学的に決める作業です。


公式

1. z検定(母分散既知・大標本)

$$

z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}

$$

2. t検定(母分散未知・小標本)

$$

t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}}

$$

3. 2標本の比率検定(ABテストで最頻出)

$$

z = \frac{\hat{p}_A - \hat{p}_B}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_A} + \frac{1}{n_B}\right)}}

$$

ここで:

- $\bar{x}$:標本平均

- $\mu_0$:帰無仮説の母平均

- $s$:標本標準偏差

- $n$:サンプルサイズ

- $\hat{p}$:統合した比率

具体例:既存LPのCVRが3.0%、新LPのCVRが3.6%、各群のサンプルサイズが10,000の場合:

$$

z = \frac{0.036 - 0.030}{\sqrt{0.033 \times 0.967 \times \left(\frac{1}{10000} + \frac{1}{10000}\right)}} \approx 2.34

$$

z = 2.34 は有意水準5%(両側検定、臨界値1.96)を超えるため、「新LPはCVRを有意に改善した」と判断できます。


対比表:主要な検定手法の使い分け

検定手法用途データ型サンプル条件EC実務での例
z検定平均の比較連続n ≥ 30平均注文額(AOV)の比較
t検定(1標本)平均 vs 基準値連続n < 30新規顧客の平均LTV vs 目標値
t検定(2標本)2群の平均比較連続小〜中規模会員ランク別の購買頻度差
比率検定2群のCVR比較二値大規模ABテストのCVR検証
カイ二乗検定独立性の検証カテゴリ任意流入チャネルと購入有無の関連
ANOVA3群以上の平均比較連続任意5つの広告クリエイティブのROAS比較

応用シーン:DTC/ECでの実践

1. ABテストの判定

新商品ページのCVRが既存比で+0.6pt(3.0% → 3.6%)改善。サンプル各10,000でp値 = 0.019 < 0.05 なら、本番反映の意思決定を下せます。

2. メール施策の効果検証

休眠顧客5,000人を2群に分け、クーポンあり群の復帰率が12.4%、なし群が9.8%。比率検定で有意差を確認し、ROIを試算。

3. 価格感度テスト

3つの価格帯(2,980円 / 3,480円 / 3,980円)でCVRとAOVをANOVA検定。3,480円が最も売上貢献が高いと統計的に裏付け。

4. チャネル別ROAS比較

Meta広告とGoogle広告のROAS差が1.8 vs 2.3。t検定で有意差を確認し、予算配分を最適化。


よくある誤解

❌ 誤解1:「p < 0.05なら効果がある」

p値は「帰無仮説が正しいときにこのデータが観測される確率」であり、効果の大きさ(実務的有意性)は別問題。CVR +0.01ptでもnが大きければ有意になります。

❌ 誤解2:「有意でなければ効果ゼロ」

「差がない」ではなく「差を検出できなかった」だけ。サンプル不足や検出力(Power)不足の可能性を必ず確認しましょう。目安としてPower ≥ 0.80を確保。

❌ 誤解3:「途中で結果を見てOK」

ABテストのピーキング(Peeking) は偽陽性を激増させます。事前にサンプルサイズと期間を固定し、途中で判断しないのが鉄則。

❌ 誤解4:「多重比較を無視」

5つのセグメントで同時に検定すると、少なくとも1つが偽陽性になる確率は約23%。Bonferroni補正などで有意水準を調整しましょう。

❌ 誤解5:「相関=因果」

検定で有意差が出ても、交絡因子が存在する可能性があります。可能ならRCT(ランダム化比較試験) を設計。


関連用語

- p値(p-value):帰無仮説のもとで観測データ以上の極端な結果が得られる確率

- 有意水準(α):棄却の閾値、慣例的に0.05または0.01

- 検出力(Power):真の効果を検出できる確率、1−β

- 信頼区間(CI):母数の推定範囲、95% CIが一般的

- 効果量(Effect Size):Cohen's d、相対リフトなど

- サンプルサイズ設計:検出力分析による事前計算

- 多重比較補正:Bonferroni、Benjamini-Hochberg法

- ベイズ検定:p値を使わない代替アプローチ


仮説検定は「なんとなく良さそう」を「統計的に言える」に変える強力な武器です。ただし、ビジネス判断はp値だけでなく、効果量・コスト・実装難易度を総合して行うことが、DTC/ECグロースの鍵となります。