ZHENESJAKOTHVIRUFRAR

Hypothesis Testing

นิยาม

การทดสอบสมมติฐาน (Hypothesis Testing) คือกระบวนการทางสถิติที่ใช้ข้อมูลจาก ตัวอย่าง (Sample) เพื่อตัดสินใจว่าสมมติฐานเกี่ยวกับ ประชากร (Population) นั้นเป็นจริงหรือไม่ โดยเราจะตั้งสมมติฐานสองข้อคู่กันเสมอ คือ:

- H₀ (Null Hypothesis) — สมมติฐานว่าง มักเป็นสถานะ "ไม่มีผล ไม่ต่าง ไม่เปลี่ยน" เช่น ยอด Conversion Rate เท่าเดิม

- H₁ (Alternative Hypothesis) — สมมติฐานทางเลือก คือสิ่งที่เราอยากพิสูจน์ เช่น หลังเปลี่ยนหน้า Landing Page แล้ว Conversion Rate สูงขึ้นจริง

หัวใจสำคัญคือเรา ไม่ได้พิสูจน์ว่า H₀ จริง แต่เราหาหลักฐานจากข้อมูลตัวอย่างว่า "มากพอที่จะปฏิเสธ H₀ หรือไม่" ผ่านค่า p-value และ ระดับนัยสำคัญ (α)


Analogy แบบคนทำ DTC

ลองนึกภาพคุณเปิดร้านขายเสื้อผ้าออนไลน์ แล้วเปลี่ยนปุ่ม CTA จาก "เพิ่มลงตะกร้า" เป็น "ซื้อเลย" คุณอยากรู้ว่าปุ่มใหม่ดีขึ้นจริงไหม

- H₀ = ปุ่มใหม่ไม่ได้ทำให้ Conversion Rate ดีขึ้น (ความต่างที่เห็นเป็นแค่ความบังเอิญ)

- H₁ = ปุ่มใหม่ทำให้ Conversion Rate ดีขึ้นจริง

คุณสุ่มลูกค้า 2 กลุ่ม กลุ่มละ 5,000 คน (A/B Test) แล้ววัดผล ถ้าปุ่มใหม่ได้ Conversion 4.2% เทียบกับปุ่มเก่า 3.6% คำถามคือ "ต่าง 0.6% นี้คือของจริง หรือแค่โชคช่วย?"

การทดสอบสมมติฐานคือ "เครื่องตัดสิน" ที่บอกว่าคุณควรเชื่อความต่างนี้หรือไม่ ก่อนจะเทงบโฆษณาทั้งหมดไปกับปุ่มใหม่


สูตร (Formulas)

1. Z-test สำหรับสัดส่วน (Proportion) — ใช้บ่อยสุดใน DTC

$$Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}$$

โดยที่ $\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}$ คือสัดส่วนรวม

2. T-test สำหรับค่าเฉลี่ย (Mean) — เช่น AOV

$$t = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}$$

3. การตัดสินใจ

- ถ้า p-value < α (ปกติ α = 0.05) → ปฏิเสธ H₀ มีนัยสำคัญทางสถิติ

- ถ้า p-value ≥ α → ไม่สามารถปฏิเสธ H₀ (ยังสรุปไม่ได้ว่าต่าง)


(ตารางเปรียบเทียบ)

หัวข้อNull Hypothesis (H₀)Alternative Hypothesis (H₁)
ความหมายสถานะเดิม ไม่มีผลมีผล/แตกต่างจริง
ตัวอย่าง DTCปุ่มใหม่ Conv. = ปุ่มเก่าปุ่มใหม่ Conv. > ปุ่มเก่า
ภาระการพิสูจน์ข้อมูลต้อง "หักล้าง"ข้อมูลต้อง "สนับสนุน"
ผลลัพธ์p ≥ α → ยังเชื่อ H₀p < α → ปฏิเสธ H₀
ความผิดพลาดType I Error (α)Type II Error (β)
ใช้เมื่อเป็น default ที่ต้องหักล้างเป็นสิ่งที่อยากพิสูจน์

Type I Error (α): สรุปว่าปุ่มใหม่ดีขึ้น ทั้งที่จริงไม่ต่าง → เสี่ยงเทงบผิด

Type II Error (β): สรุปว่าไม่ต่าง ทั้งที่จริงดีขึ้น → พลาดโอกาสเติบโต


(Use Cases ในธุรกิจ DTC/อีคอมเมิร์ซ)

1. A/B Test ปุ่ม CTA หรือหน้า Landing Page

สมมติกลุ่ม A (ปุ่มเก่า) n = 8,000 คน ได้ Conversion 3.6% (288 ออเดอร์) กลุ่ม B (ปุ่มใหม่) n = 8,000 คน ได้ Conversion 4.2% (336 ออเดอร์) คำนวณ Z-test ได้ p-value = 0.042 < 0.05 → ปฏิเสธ H₀ สรุปว่าปุ่มใหม่ดีขึ้นจริง

2. ทดสอบว่าโปรโมชันเพิ่ม AOV ไหม

ก่อนโปร AOV = ฿1,250 (n = 1,200) หลังโปร AOV = ฿1,380 (n = 1,150) ใช้ T-test ดูว่าที่เพิ่ม ฿130 นั้นมีนัยสำคัญหรือแค่ลูกค้าซื้อของแพงขึ้นโดยบังเอิญ

3. เปรียบเทียบ Conversion Rate ระหว่างช่องทาง

Facebook Ads vs TikTok Ads กลุ่มละ 15,000 คลิก วัดว่า CVR ต่างกันจริงไหม ก่อนตัดงบไปช่องทางใดช่องทางหนึ่ง

4. ทดสอบ Retention / Repeat Purchase Rate

หลังส่งอีเมล CRM ชุดใหม่ ดูว่า Repeat Rate ใน 30 วัน เพิ่มขึ้นจริงเทียบกลุ่มควบคุมหรือไม่

5. ตรวจสอบคุณภาพข้อมูลก่อน Scale

ก่อนสเกลแคมเปญจาก ฿50,000/วัน เป็น ฿500,000/วัน ต้องมั่นใจว่า ROAS ที่เห็นไม่ใช่ noise


(ข้อเข้าใจผิดที่พบบ่อย)

❌ "p-value ต่ำ = ผลต่างใหญ่"

ผิด! p-value บอกแค่ "ความมั่นใจว่ามีความต่าง" ไม่ได้บอกขนาดของผล กลุ่มตัวอย่าง 1 ล้านคนอาจได้ p < 0.001 กับผลต่างแค่ 0.1% ซึ่งไม่มีนัยสำคัญทางธุรกิจ

❌ "p ≥ 0.05 = ไม่มีผล"

ผิด! อาจเป็นเพราะ sample เล็กเกินไป (Underpowered) ต้องดู Power (1-β) ด้วย ปกติควรมี Power ≥ 0.80

❌ "Peeking ระหว่างเทสได้เรื่อยๆ"

การแอบดูผลทุกวันแล้วหยุดเมื่อ p < 0.05 จะเพิ่ม False Positive Rate อย่างมหาศาล ต้องกำหนดระยะเวลา/ขนาดตัวอย่างล่วงหน้า

❌ "ทดสอบหลายตัวแปรพร้อมกันโดยไม่ปรับ α"

ถ้าเทส 20 hypotheses ที่ α = 0.05 คาดว่าจะเจอ False Positive ประมาณ 1 ครั้ง ต้องใช้ Bonferroni Correction (α/จำนวนเทส) หรือ FDR

❌ "Statistical Significance = Practical Significance"

Conversion เพิ่ม 0.05% อาจ p < 0.05 แต่กำไรที่เพิ่มไม่คุ้มค่าพัฒนา ต้องดู Effect Size และ ROI ควบคู่เสมอ


(คำศัพท์ที่เกี่ยวข้อง)

- p-value — ความน่าจะเป็นที่จะเห็นผลเท่านี้หรือสุดกว่านี้ หาก H₀ จริง

- α (Significance Level) — เกณฑ์ตัดสิน มักใช้ 0.05 หรือ 0.01

- Power (1-β) — โอกาสตรวจจับผลได้จริง เมื่อผลนั้นมีอยู่

- Effect Size — ขนาดของความแตกต่าง (เช่น Cohen's d, Lift %)

- Confidence Interval (CI) — ช่วงความเชื่อมั่น 95% ของค่าประมาณ

- Sample Size Calculation — การคำนวณขนาดตัวอย่างล่วงหน้า

- A/B Testing — การทดลองเปรียบเทียบสองเวอร์ชัน

- Type I / Type II Error — False Positive / False Negative

- Multiple Comparison — การทดสอบหลายสมมติฐานพร้อมกัน

- Statistical Power Analysis — การวิเคราะห์กำลังการทดสอบ


สรุปสั้นๆ สำหรับคนทำ DTC: การทดสอบสมมติฐานคือ "เกราะป้องกัน" ไม่ให้คุณตัดสินใจลงงบมหาศาลจากความรู้สึกหรือตัวเลขที่บังเอิญสวย ตั้ง H₀/H₁ ให้ชัด กำหนด α และ sample size ล่วงหน้า อย่า peek แล้วหยุดเมื่อได้ผลที่อยากได้ และอย่าลืมดู Effect Size ว่าคุ้มค่าทางธุรกิจจริงหรือไม่ — เพราะในอีคอมเมิร์ซ สถิติที่ดีต้องแปลงเป็นกำไรได้