นิยาม
การทดสอบสมมติฐาน (Hypothesis Testing) คือกระบวนการทางสถิติที่ใช้ข้อมูลจาก ตัวอย่าง (Sample) เพื่อตัดสินใจว่าสมมติฐานเกี่ยวกับ ประชากร (Population) นั้นเป็นจริงหรือไม่ โดยเราจะตั้งสมมติฐานสองข้อคู่กันเสมอ คือ:
- H₀ (Null Hypothesis) — สมมติฐานว่าง มักเป็นสถานะ "ไม่มีผล ไม่ต่าง ไม่เปลี่ยน" เช่น ยอด Conversion Rate เท่าเดิม
- H₁ (Alternative Hypothesis) — สมมติฐานทางเลือก คือสิ่งที่เราอยากพิสูจน์ เช่น หลังเปลี่ยนหน้า Landing Page แล้ว Conversion Rate สูงขึ้นจริง
หัวใจสำคัญคือเรา ไม่ได้พิสูจน์ว่า H₀ จริง แต่เราหาหลักฐานจากข้อมูลตัวอย่างว่า "มากพอที่จะปฏิเสธ H₀ หรือไม่" ผ่านค่า p-value และ ระดับนัยสำคัญ (α)
Analogy แบบคนทำ DTC
ลองนึกภาพคุณเปิดร้านขายเสื้อผ้าออนไลน์ แล้วเปลี่ยนปุ่ม CTA จาก "เพิ่มลงตะกร้า" เป็น "ซื้อเลย" คุณอยากรู้ว่าปุ่มใหม่ดีขึ้นจริงไหม
- H₀ = ปุ่มใหม่ไม่ได้ทำให้ Conversion Rate ดีขึ้น (ความต่างที่เห็นเป็นแค่ความบังเอิญ)
- H₁ = ปุ่มใหม่ทำให้ Conversion Rate ดีขึ้นจริง
คุณสุ่มลูกค้า 2 กลุ่ม กลุ่มละ 5,000 คน (A/B Test) แล้ววัดผล ถ้าปุ่มใหม่ได้ Conversion 4.2% เทียบกับปุ่มเก่า 3.6% คำถามคือ "ต่าง 0.6% นี้คือของจริง หรือแค่โชคช่วย?"
การทดสอบสมมติฐานคือ "เครื่องตัดสิน" ที่บอกว่าคุณควรเชื่อความต่างนี้หรือไม่ ก่อนจะเทงบโฆษณาทั้งหมดไปกับปุ่มใหม่
สูตร (Formulas)
1. Z-test สำหรับสัดส่วน (Proportion) — ใช้บ่อยสุดใน DTC
$$Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}$$
โดยที่ $\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}$ คือสัดส่วนรวม
2. T-test สำหรับค่าเฉลี่ย (Mean) — เช่น AOV
$$t = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}$$
3. การตัดสินใจ
- ถ้า p-value < α (ปกติ α = 0.05) → ปฏิเสธ H₀ มีนัยสำคัญทางสถิติ
- ถ้า p-value ≥ α → ไม่สามารถปฏิเสธ H₀ (ยังสรุปไม่ได้ว่าต่าง)
(ตารางเปรียบเทียบ)
| หัวข้อ | Null Hypothesis (H₀) | Alternative Hypothesis (H₁) |
|---|---|---|
| ความหมาย | สถานะเดิม ไม่มีผล | มีผล/แตกต่างจริง |
| ตัวอย่าง DTC | ปุ่มใหม่ Conv. = ปุ่มเก่า | ปุ่มใหม่ Conv. > ปุ่มเก่า |
| ภาระการพิสูจน์ | ข้อมูลต้อง "หักล้าง" | ข้อมูลต้อง "สนับสนุน" |
| ผลลัพธ์ | p ≥ α → ยังเชื่อ H₀ | p < α → ปฏิเสธ H₀ |
| ความผิดพลาด | Type I Error (α) | Type II Error (β) |
| ใช้เมื่อ | เป็น default ที่ต้องหักล้าง | เป็นสิ่งที่อยากพิสูจน์ |
Type I Error (α): สรุปว่าปุ่มใหม่ดีขึ้น ทั้งที่จริงไม่ต่าง → เสี่ยงเทงบผิด
Type II Error (β): สรุปว่าไม่ต่าง ทั้งที่จริงดีขึ้น → พลาดโอกาสเติบโต
(Use Cases ในธุรกิจ DTC/อีคอมเมิร์ซ)
1. A/B Test ปุ่ม CTA หรือหน้า Landing Page
สมมติกลุ่ม A (ปุ่มเก่า) n = 8,000 คน ได้ Conversion 3.6% (288 ออเดอร์) กลุ่ม B (ปุ่มใหม่) n = 8,000 คน ได้ Conversion 4.2% (336 ออเดอร์) คำนวณ Z-test ได้ p-value = 0.042 < 0.05 → ปฏิเสธ H₀ สรุปว่าปุ่มใหม่ดีขึ้นจริง
2. ทดสอบว่าโปรโมชันเพิ่ม AOV ไหม
ก่อนโปร AOV = ฿1,250 (n = 1,200) หลังโปร AOV = ฿1,380 (n = 1,150) ใช้ T-test ดูว่าที่เพิ่ม ฿130 นั้นมีนัยสำคัญหรือแค่ลูกค้าซื้อของแพงขึ้นโดยบังเอิญ
3. เปรียบเทียบ Conversion Rate ระหว่างช่องทาง
Facebook Ads vs TikTok Ads กลุ่มละ 15,000 คลิก วัดว่า CVR ต่างกันจริงไหม ก่อนตัดงบไปช่องทางใดช่องทางหนึ่ง
4. ทดสอบ Retention / Repeat Purchase Rate
หลังส่งอีเมล CRM ชุดใหม่ ดูว่า Repeat Rate ใน 30 วัน เพิ่มขึ้นจริงเทียบกลุ่มควบคุมหรือไม่
5. ตรวจสอบคุณภาพข้อมูลก่อน Scale
ก่อนสเกลแคมเปญจาก ฿50,000/วัน เป็น ฿500,000/วัน ต้องมั่นใจว่า ROAS ที่เห็นไม่ใช่ noise
(ข้อเข้าใจผิดที่พบบ่อย)
❌ "p-value ต่ำ = ผลต่างใหญ่"
ผิด! p-value บอกแค่ "ความมั่นใจว่ามีความต่าง" ไม่ได้บอกขนาดของผล กลุ่มตัวอย่าง 1 ล้านคนอาจได้ p < 0.001 กับผลต่างแค่ 0.1% ซึ่งไม่มีนัยสำคัญทางธุรกิจ
❌ "p ≥ 0.05 = ไม่มีผล"
ผิด! อาจเป็นเพราะ sample เล็กเกินไป (Underpowered) ต้องดู Power (1-β) ด้วย ปกติควรมี Power ≥ 0.80
❌ "Peeking ระหว่างเทสได้เรื่อยๆ"
การแอบดูผลทุกวันแล้วหยุดเมื่อ p < 0.05 จะเพิ่ม False Positive Rate อย่างมหาศาล ต้องกำหนดระยะเวลา/ขนาดตัวอย่างล่วงหน้า
❌ "ทดสอบหลายตัวแปรพร้อมกันโดยไม่ปรับ α"
ถ้าเทส 20 hypotheses ที่ α = 0.05 คาดว่าจะเจอ False Positive ประมาณ 1 ครั้ง ต้องใช้ Bonferroni Correction (α/จำนวนเทส) หรือ FDR
❌ "Statistical Significance = Practical Significance"
Conversion เพิ่ม 0.05% อาจ p < 0.05 แต่กำไรที่เพิ่มไม่คุ้มค่าพัฒนา ต้องดู Effect Size และ ROI ควบคู่เสมอ
(คำศัพท์ที่เกี่ยวข้อง)
- p-value — ความน่าจะเป็นที่จะเห็นผลเท่านี้หรือสุดกว่านี้ หาก H₀ จริง
- α (Significance Level) — เกณฑ์ตัดสิน มักใช้ 0.05 หรือ 0.01
- Power (1-β) — โอกาสตรวจจับผลได้จริง เมื่อผลนั้นมีอยู่
- Effect Size — ขนาดของความแตกต่าง (เช่น Cohen's d, Lift %)
- Confidence Interval (CI) — ช่วงความเชื่อมั่น 95% ของค่าประมาณ
- Sample Size Calculation — การคำนวณขนาดตัวอย่างล่วงหน้า
- A/B Testing — การทดลองเปรียบเทียบสองเวอร์ชัน
- Type I / Type II Error — False Positive / False Negative
- Multiple Comparison — การทดสอบหลายสมมติฐานพร้อมกัน
- Statistical Power Analysis — การวิเคราะห์กำลังการทดสอบ
สรุปสั้นๆ สำหรับคนทำ DTC: การทดสอบสมมติฐานคือ "เกราะป้องกัน" ไม่ให้คุณตัดสินใจลงงบมหาศาลจากความรู้สึกหรือตัวเลขที่บังเอิญสวย ตั้ง H₀/H₁ ให้ชัด กำหนด α และ sample size ล่วงหน้า อย่า peek แล้วหยุดเมื่อได้ผลที่อยากได้ และอย่าลืมดู Effect Size ว่าคุ้มค่าทางธุรกิจจริงหรือไม่ — เพราะในอีคอมเมิร์ซ สถิติที่ดีต้องแปลงเป็นกำไรได้