정의
가설검정(Hypothesis Testing)은 표본(Sample) 데이터를 기반으로 모집단(Population)에 대한 가설이 통계적으로 유의한지 판단하는 추론 통계 기법입니다. DTC·이커머스 맥락에서는 “새로운 랜딩페이지가 기존 페이지보다 전환율이 정말 높은가?”, “할인 쿠폰이 AOV(평균 주문 금액)를 실제로 끌어올렸는가?” 같은 의사결정 질문에 감이 아니라 확률로 답하기 위해 사용됩니다.
핵심 구조는 두 개의 가설로 시작합니다.
- 귀무가설(H₀, Null Hypothesis): “차이가 없다 / 효과가 없다”는 기본 가정
- 대립가설(H₁, Alternative Hypothesis): “차이가 있다 / 효과가 있다”는 우리가 입증하려는 주장
검정의 결론은 H₀를 기각(Reject) 할지, 기각하지 못함(Fail to Reject) 인지로 나뉩니다. 여기서 “H₀를 채택한다”라는 표현은 엄밀히는 틀렸고, “기각할 증거가 부족하다”가 정확합니다.
비유로 이해하기
여러분이 한국 DTC 브랜드를 운영 중이고, 신규 고객 1,000명에게 A/B 테스트를 돌렸다고 가정해봅시다.
- A안(기존 랜딩): 전환율 3.2%
- B안(신규 랜딩): 전환율 3.9%
겉보기엔 B가 0.7%p 높아 보입니다. 하지만 이 차이가 우연히 발생한 노이즈일 수도 있습니다. 가설검정은 “이 0.7%p 차이가 통계적으로 우연이라고 보기 어려운 수준인가?”를 p-value와 신뢰구간으로 판정합니다.
쉽게 말해 법정 비유가 가장 정확합니다.
- H₀ = “피고는 무죄다” (기본값)
- H₁ = “피고는 유죄다”
- 증거(표본 데이터)가 충분히 강력해야만 H₀를 기각(=유죄 판결)할 수 있음
- “증거 부족”은 “무죄 확정”이 아님
공식
1) Z-검정 (모분산을 알거나 대표본, n ≥ 30)
$$
Z = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}}
$$
- $\bar{X}$: 표본평균
- $\mu_0$: 귀무가설의 모평균
- $\sigma$: 모표준편차
- $n$: 표본 크기
2) T-검정 (모분산 미지, 소표본)
$$
t = \frac{\bar{X} - \mu_0}{s / \sqrt{n}}, \quad df = n - 1
$$
3) 두 집단 비율 차이 검정 (A/B 테스트 핵심)
$$
Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}
$$
여기서 $\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}$ (합동 비율)
4) p-value 해석 기준
- $p < 0.05$: 통계적으로 유의 → H₀ 기각
- $p \ge 0.05$: 유의하지 않음 → H₀ 기각 실패
비교표: 자주 쓰는 검정 방법
| 검정 방법 | 사용 상황 | 예시 (DTC 맥락) | 전제 조건 |
|---|---|---|---|
| One-sample t-test | 한 집단 평균 vs 기준값 | 신규 멤버십 회원 AOV가 50,000원인가? | 정규성 근사 |
| Two-sample t-test | 두 집단 평균 비교 | 쿠폰 그룹 vs 비쿠폰 그룹 AOV | 등분산(또는 Welch) |
| Paired t-test | 동일 대상 전/후 비교 | 리뉴얼 전후 동일 고객 재구매율 | 짝지어진 데이터 |
| Two-proportion Z-test | 두 집단 전환율 비교 | A랜딩 3.2% vs B랜딩 3.9% | n ≥ 30, np ≥ 5 |
| Chi-square test | 범주형 변수 독립성 | 성별 × 카테고리 구매 연관성 | 기대빈도 ≥ 5 |
| ANOVA | 3개 이상 집단 평균 | 3개 크리에이티브 CTR 비교 | 등분산, 정규성 |
DTC·이커머스 적용 시나리오
시나리오 1: 랜딩페이지 A/B 테스트
- A안: 노출 12,000 / 전환 384 → 전환율 3.20%
- B안: 노출 12,000 / 전환 468 → 전환율 3.90%
- 합동 비율 $\hat{p} = (384+468)/24{,}000 = 0.0355$
- Z ≈ 2.94, p-value ≈ 0.0033
→ p < 0.05이므로 H₀ 기각. B안이 통계적으로 유의하게 우수. B안 전면 롤아웃 결정 가능.
시나리오 2: 리텐션 캠페인 효과
- 대조군 30일 재구매율 18.4% (n=2,500)
- 캠페인군 30일 재구매율 20.1% (n=2,500)
- Z ≈ 1.52, p-value ≈ 0.128
→ p ≥ 0.05. 통계적으로 유의하지 않음. “캠페인이 효과 있다”고 결론 내리면 안 되며, 표본을 늘리거나 기간을 연장해 재검정 필요.
시나리오 3: 가격 인상 테스트
- 기존가 그룹 AOV ₩62,000 (n=1,800, s=₩21,000)
- 인상가 그룹 AOV ₩64,500 (n=1,800, s=₩22,500)
- t ≈ 3.44, df ≈ 3,590, p-value ≈ 0.0006
→ 유의. 다만 전환율 하락이 동반됐는지 반드시 확인. AOV만 보면 함정.
흔한 오해 (실무에서 자주 터지는 이슈)
1. “p < 0.05면 효과 크기가 크다”
→ 틀림. p-value는 “우연일 확률”이지 “효과의 크기”가 아님. Effect Size(Cohen’s d, 상대 리프트) 를 함께 봐야 함.
2. “p ≥ 0.05면 효과가 없다”
→ 틀림. “증거 부족”일 뿐. 표본이 작으면 진짜 효과도 못 잡음(검정력 부족).
3. 다중 검정(Multiple Testing) 무시
→ 20개 변형을 동시에 테스트하면 우연히 1개는 p < 0.05 나옴. Bonferroni 보정($\alpha/m$) 필수.
4. Peeking(중간 들여다보기)
→ 테스트 도중 매일 p-value 확인하고 조기 종료하면 1종 오류 폭증. 사전 표본 크기 산정 후 고정 기간 운영.
5. SRM(Sample Ratio Mismatch) 간과
→ 50:50 배분인데 48:52로 나오면 트래킹 버그 가능성. 검정 전 필수 체크.
6. 통계적 유의성 ≠ 비즈니스 유의성
→ 전환율 0.05%p 상승이 p < 0.001이어도, 구현 비용 대비 손해일 수 있음. ROI 관점 판단 필수.
관련 용어
- P-value: H₀가 참일 때 관측 결과 이상이 나올 확률
- 유의수준(α): 1종 오류 허용 한계, 통상 0.05
- 검정력(Power, 1-β): 실제 효과를 탐지할 확률, 0.8 이상 권장
- 1종 오류 / 2종 오류: False Positive / False Negative
- 신뢰구간(CI): 효과 크기의 추정 범위
- Effect Size: Cohen’s d, 상대 리프트(%)
- A/B 테스트: 가설검정의 대표적 실무 적용
- MDE(Minimum Detectable Effect): 탐지 가능한 최소 효과 크기
- Sequential Testing / Bayesian Testing: Peeking 문제 완화 대안
가설검정은 DTC·이커머스에서 “감”을 “근거”로 바꿔주는 의사결정 엔진입니다. 다만 p-value 하나만 보고 뛰지 말고, 효과 크기·신뢰구간·비즈니스 임팩트를 함께 놓고 판단하는 습관이 진짜 실력을 만듭니다.