ZHENESJAKOTHVIRUFRAR

P-value

นิยามของ P-value

P-value (ค่า P) คือ ความน่าจะเป็นที่จะได้ผลลัพธ์ที่เท่ากับหรือสุดโต่งกว่าที่เราเห็นจริง ภายใต้สมมติฐานว่า "สมมติฐานว่าง" (Null Hypothesis) เป็นจริง

พูดแบบบ้าน ๆ ให้เข้าใจในบริบทของคนขายออนไลน์: สมมติคุณเปลี่ยนปุ่ม CTA บนหน้า Landing Page แล้วยอด Conversion เพิ่มขึ้น ค่า P จะตอบคำถามว่า "ถ้าการเปลี่ยนปุ่มนี้ไม่ได้ช่วยอะไรเลย การเพิ่มขึ้นแบบนี้เกิดขึ้นได้บ่อยแค่ไหนจากการสุ่ม?"

ถ้าค่า P น้อยมาก (เช่น 0.01) แปลว่าโอกาสที่ผลลัพธ์นี้จะเกิดจากความบังเอิญมีแค่ 1% → เรามั่นใจพอที่จะบอกว่า "การเปลี่ยนปุ่มได้ผลจริง"


ค่า P เหมือน "การจับโกหกของนักพนัน"

ลองนึกภาพเพื่อนร่วมงานบอกว่า "ทอยลูกเต๋าได้ 6 สองครั้งติด" ถ้าเขาทอยแค่ 2 ครั้ง โอกาสเกิดเรื่องนี้คือ 1/36 = 2.78% ก็ไม่แปลกอะไร

แต่ถ้าเขาบอกว่า "ทอยได้ 6 ติดกัน 5 ครั้ง" โอกาสคือ (1/6)^5 = 0.0128% → คุณเริ่มสงสัยว่า "ลูกเต๋านี้โกงหรือเปล่า?"

นี่แหละคือหัวใจของค่า P — มันบอกว่า "ถ้าทุกอย่างยุติธรรม (Null เป็นจริง) เราเห็นผลแบบนี้ได้ยากแค่ไหน" ยิ่งยาก → ยิ่งมีหลักฐานว่ามีอะไร "จริง" อยู่เบื้องหลัง

ใน DTC การ "ทอยลูกเต๋า" อาจหมายถึงการสุ่มลูกค้า 2 กลุ่ม (A/B Test) แล้วดูว่าใครซื้อมากกว่ากัน


สูตรและวิธีคำนวณ

โดยทั่วไป P-value คำนวณจาก ค่า Z-score หรือ t-statistic ขึ้นอยู่กับขนาดตัวอย่าง

$$Z = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}$$

เมื่อ:

- $\bar{x}$ = ค่าเฉลี่ยของกลุ่มทดลอง

- $\mu_0$ = ค่าเฉลี่ยที่คาดหวังตามสมมติฐานว่าง

- $\sigma$ = ส่วนเบี่ยงเบนมาตรฐาน

- $n$ = ขนาดตัวอย่าง

ตัวอย่างจริง: ร้านค้าออนไลน์ทดสอบอีเมล 2 แบบ

- กลุ่ม A (เดิม): Conversion Rate = 3.2% จาก $n = 5{,}000$

- กลุ่ม B (ใหม่): Conversion Rate = 3.8% จาก $n = 5{,}000$

- Pooled proportion = 3.5%, Standard Error = 0.00116

- $Z = (0.038 - 0.032) / 0.00116 ≈ 5.17$

- P-value < 0.0001 → ปฏิเสธสมมติฐานว่าง → อีเมลใหม่ดีจริง


ตารางเปรียบเทียบค่า P กับระดับนัยสำคัญ

ค่า Pตีความระดับหลักฐานการตัดสินใจใน DTC
P < 0.001น้อยมากหลักฐานแข็งแกร่งมากScale แคมเปญทันที
0.001 ≤ P < 0.01น้อยหลักฐานแข็งแกร่งทดสอบซ้ำก่อน Scale
0.01 ≤ P < 0.05ปานกลางมีนัยสำคัญทางสถิติเริ่มใช้กับบาง Segment
0.05 ≤ P < 0.10ค่อนข้างสูงหลักฐานอ่อนเก็บข้อมูลเพิ่ม
P ≥ 0.10สูงไม่มีหลักฐานไม่ควรเปลี่ยนอะไร

เกณฑ์มาตรฐานที่ใช้กันทั่วไปคือ α = 0.05 แต่ในธุรกิจ E-commerce ที่มีการทดสอบหลายครั้งต่อวัน ควรใช้ α = 0.01 เพื่อลด False Positive


ในธุรกิจ DTC

1. A/B Test ปุ่ม CTA

คุณเปลี่ยนข้อความปุ่มจาก "ซื้อเลย" เป็น "รับส่วนลด 20% ทันที" ทดสอบกับลูกค้า 10,000 คน (5,000 ต่อกลุ่ม) พบว่า CTR เพิ่มจาก 4.1% → 5.3%

- คำนวณได้ P = 0.003 → มีนัยสำคัญ → เปลี่ยนปุ่มใหม่ทั้งเว็บ

2. ทดสอบราคาสินค้า

ตั้งราคา ฿990 vs ฿1,190 กับกลุ่มลูกค้า 3,000 คน พบว่า AOV ต่างกัน ฿45

- P = 0.08 → ไม่มีนัยสำคัญที่ α = 0.05 → ยังไม่ควรสรุปว่าราคาไหนดีกว่า

3. เปรียบเทียบ Creative โฆษณา

ทดสอบ 3 แบบบน Meta Ads งบ ฿30,000 พบว่า ROAS ต่างกัน

- ต้องใช้ Bonferroni Correction เพราะทดสอบหลายคู่ → α ใหม่ = 0.05/3 ≈ 0.0167

4. วัดผล Retention

เปรียบเทียบลูกค้าที่ได้รับ SMS vs ไม่ได้รับ หลัง 30 วัน พบ repurchase rate ต่างกัน 2.1%

- P = 0.02 → มีนัยสำคัญ → ลงทุนใน SMS campaign


(ข้อเข้าใจผิดที่พบบ่อย)

❌ 1: "P-value = ความน่าจะเป็นที่สมมติฐานว่างเป็นจริง"

ผิด! ค่า P ไม่ได้บอกความน่าจะเป็นของสมมติฐาน มันบอกความน่าจะเป็นของ "ข้อมูล" ภายใต้สมมติฐาน

❌ 2: "P < 0.05 = ผลลัพธ์สำคัญทางธุรกิจ"

ผิด! นัยสำคัญทางสถิติ ≠ นัยสำคัญทางธุรกิจ ถ้า Conversion เพิ่ม 0.01% แต่ P = 0.001 ก็ไม่คุ้มที่จะเปลี่ยนระบบ

❌ 3: "P > 0.05 = ไม่มีความแตกต่าง"

ผิด! อาจเป็นเพราะ sample size เล็กเกินไป ลองเพิ่ม n แล้วคำนวณใหม่

❌ 4: "ทดสอบหลายครั้งแล้วใช้ α = 0.05 ตลอด"

ผิด! ยิ่งทดสอบเยอะ ยิ่งเสี่ยง False Positive ต้องปรับ α ด้วย Bonferroni หรือ FDR

❌ 5: "ดูแค่ P-value ไม่ดู Effect Size"

ผิด! ต้องดูค่า Lift % และ Confidence Interval ประกอบด้วยเสมอ


##

- Null Hypothesis (H₀) — สมมติฐานว่าง เช่น "ปุ่มใหม่ไม่ต่างจากปุ่มเดิม"

- Alternative Hypothesis (H₁) — สมมติฐานทางเลือก เช่น "ปุ่มใหม่ดีกว่า"

- Significance Level (α) — เกณฑ์ตัดสิน มักใช้ 0.05 หรือ 0.01

- Type I Error — ปฏิเสธ H₀ ที่จริง (False Positive)

- Type II Error — ยอมรับ H₀ ที่ผิด (False Negative)

- Statistical Power (1-β) — โอกาสตรวจจับความแตกต่างได้จริง มักต้องการ ≥ 80%

- Confidence Interval (CI) — ช่วงความเชื่อมั่น เช่น 95% CI ของ Lift = [1.2%, 4.8%]

- Effect Size — ขนาดของความแตกต่าง เช่น Cohen's d, Lift %

- Multiple Testing Correction — Bonferroni, Benjamini-Hochberg

- Bayesian A/B Testing — ทางเลือกที่ตีความง่ายกว่า P-value สำหรับคนทำธุรกิจ


สรุปสำหรับคนทำ DTC

ค่า P คือ เครื่องมือกรองสัญญาณรบกวน ไม่ใช่คำตอบสุดท้าย ใช้มันคู่กับ:

1. Effect Size — ผลต่างใหญ่พอที่จะขยับยอดขายไหม?

2. Sample Size — เก็บข้อมูลมากพอหรือยัง?

3. Business Context — คุ้มค่ากับต้นทุนเปลี่ยนไหม?

ถ้า P < 0.05 และ Lift > 5% บน sample ใหญ่พอ → ลงมือทำได้เลย

ถ้า P > 0.05 → อย่าเพิ่งรีบเปลี่ยน เก็บข้อมูลเพิ่มหรือออกแบบการทดสอบใหม่

การตัดสินใจที่ดีใน E-commerce ไม่ได้มาจากค่า P เพียงตัวเดียว แต่มาจากการผสมผสานระหว่าง สถิติ + สามัญสำเร็จ + ความเข้าใจลูกค้า ครับ