นิยาม
A/B Testing หรือที่หลายคนเรียกว่า Split Testing คือวิธีการทดลองทางการตลาดที่นำทราฟฟิกจากแหล่งเดียวกันมาแบ่งออกเป็นสองกลุ่ม (หรือมากกว่า) แบบสุ่ม แล้วแสดงหน้าเว็บ ข้อความ โฆษณา หรือราคาที่แตกต่างกันในแต่ละกลุ่ม จากนั้นวัดผลด้วยข้อมูลจริงเพื่อดูว่าเวอร์ชันไหนทำผลลัพธ์ได้ดีกว่า
ในบริบทของ DTC (Direct-to-Consumer) และอีคอมเมิร์ซไทย A/B Testing ไม่ใช่แค่การเทียบสองหน้าเว็บ แต่คือการเทียบ สองสมมติฐานทางธุรกิจ เช่น “ถ้าเปลี่ยนปุ่มซื้อเป็นสีส้ม จะกดซื้อมากขึ้นไหม” หรือ “ถ้าเพิ่มรีวิวลูกค้า 5 ดาวเหนือปุ่มซื้อ จะลดการลังเลได้หรือไม่”
หัวใจของ A/B Testing คือ การทดลองที่มีกลุ่มควบคุม (Control) และ กลุ่มทดลอง (Variant) โดยผู้ใช้ถูกสุ่มเข้าแต่ละกลุ่มแบบ 50/50 หรือสัดส่วนอื่นตามที่กำหนด เพื่อให้ความแตกต่างที่วัดได้มาจาก “สิ่งที่เราเปลี่ยน” ไม่ใช่จากปัจจัยภายนอก
Analogy
ลองนึกภาพร้านขายน้ำผลไม้ตามตลาดนัดไทย เจ้าของร้านอยากรู้ว่า แก้วแบบไหนขายดีกว่า ระหว่างแก้วใสกับแก้วสีสันสดใส
ถ้าเขาเปลี่ยนแก้วทุกวันโดยไม่ควบคุมอะไรเลย วันจันทร์ขายแก้วใส วันอังคารขายแก้วสี ฝนตกวันอังคาร ลูกค้าน้อยกว่า ก็สรุปไม่ได้ว่าแก้วสีแย่กว่า
แต่ถ้าเขา สลับแก้วแบบสุ่มให้ลูกค้าแต่ละคน คนแรกได้แก้วใส คนที่สองได้แก้วสี คนที่สามได้แก้วใส ไปเรื่อย ๆ แล้ววัดอัตราการซื้อซ้ำหรือการบอกต่อ นั่นแหละคือ A/B Testing
ในโลกออนไลน์ เราทำแบบเดียวกัน แต่ใช้ซอฟต์แวร์อย่าง Google Optimize, VWO, Optimizely หรือ Shopify A/B Testing แทนการสลับแก้วด้วยมือ
(Formula)
การคำนวณผลลัพธ์พื้นฐานของ A/B Testing ใช้สูตรเหล่านี้:
อัตราการแปลง (Conversion Rate)
CR = (จำนวน Conversion / จำนวนผู้เข้าชม) × 100
ตัวอย่าง:
- เวอร์ชัน A: ผู้เข้าชม 10,000 คน, ซื้อ 250 คน → CR = (250 / 10,000) × 100 = 2.50%
- เวอร์ชัน B: ผู้เข้าชม 10,000 คน, ซื้อ 320 คน → CR = (320 / 10,000) × 100 = 3.20%
ส่วนต่างที่เพิ่มขึ้น (Lift)
Lift = ((CR ของ B - CR ของ A) / CR ของ A) × 100
Lift = ((3.20 - 2.50) / 2.50) × 100 = +28%
นัยสำคัญทางสถิติ (Statistical Significance)
โดยทั่วไปต้องมี confidence level ≥ 95% และ p-value < 0.05 จึงสรุปได้ว่า B ดีกว่า A อย่างมีนัยสำคัญ ไม่ใช่แค่ความบังเอิญ
ขนาดตัวอย่างขั้นต่ำ (Sample Size)
ขึ้นอยู่กับ baseline CR, ขนาด lift ที่ต้องการตรวจจับ และ power (ปกติ 80%) ตัวอย่างเช่น ถ้า baseline CR = 2.5% ต้องการตรวจจับ lift +20% ที่ confidence 95% และ power 80% ต้องใช้ผู้เข้าชมประมาณ 15,000–20,000 คนต่อกลุ่ม
(Comparison Table)
| หัวข้อ | A/B Testing | การเปลี่ยนเว็บทั้งหน้า (Redesign) | การใช้ประสบการณ์ส่วนตัว (Personalization) |
|---|---|---|---|
| ขอบเขตการทดสอบ | 1 ตัวแปรต่อการทดสอบ | หลายตัวแปรพร้อมกัน | กฎแบบเรียลไทม์ตามพฤติกรรม |
| ความเสี่ยง | ต่ำ เพราะมีกลุ่มควบคุม | สูง เพราะวัดผลรวมได้ยาก | ปานกลาง ต้องมีข้อมูลเพียงพอ |
| ระยะเวลา | 1–4 สัปดาห์ | 1–3 เดือน | ต่อเนื่อง |
| ตัวอย่างขั้นต่ำ | ~15,000 คน/กลุ่ม | ไม่มีมาตรฐานชัด | ต้องมีทราฟฟิกสูงมาก |
| เหมาะกับ | ปุ่ม, headline, ราคา, รูปสินค้า | แบรนด์รีเฟรช | ลูกค้าประจำ, segmented |
| ตัวชี้วัดหลัก | CR, AOV, Revenue/Session | Brand recall, NPS | CLV, Retention |
| เครื่องมือไทยที่ใช้บ่อย | Google Optimize, VWO, Shopify | Webflow, WordPress | Klaviyo, Insider, MoEngage |
(Use Cases) ใน DTC/อีคอมเมิร์ซไทย
1. ปุ่ม CTA บนหน้า Product Page
- A: “เพิ่มลงตะกร้า” สีน้ำเงิน
- B: “ซื้อเลย รับส่วนลด 10%” สีส้ม
- ผลลัพธ์ตัวอย่าง: B เพิ่ม CR จาก 2.5% → 3.2% (+28%)
2. ราคาและโปรโมชัน
- A: ฿590 ไม่มีส่งฟรี
- B: ฿590 ส่งฟรี
- ผลลัพธ์ตัวอย่าง: B เพิ่ม AOV จาก ฿720 → ฿890 (+23.6%)
3. รูปสินค้าและวิดีโอ
- A: รูปนิ่ง 5 รูป
- B: วิดีโอ 15 วินาที + รูป 3 รูป
- ผลลัพธ์ตัวอย่าง: B ลด bounce rate จาก 62% → 48%
4. อีเมลและ SMS Campaign
- A: หัวข้อ “โปรใหม่มาแล้ว”
- B: หัวข้อ “ลด 20% เฉพาะคุณ ถึงเที่ยงคืนนี้”
- ผลลัพธ์ตัวอย่าง: B เพิ่ม open rate จาก 18% → 27%
5. หน้าชำระเงิน (Checkout)
- A: ฟอร์ม 5 ช่อง
- B: ฟอร์ม 3 ช่อง + Apple Pay
- ผลลัพธ์ตัวอย่าง: B ลด cart abandonment จาก 71% → 58%
6. โฆษณา Facebook/TikTok
- A: Creative แบบ testimonial
- B: Creative แบบ unboxing
- ผลลัพธ์ตัวอย่าง: B ลด CPA จาก ฿320 → ฿240
(Common Mistakes)
1. หยุดทดสอบเร็วเกินไป
เห็นว่า B ดีกว่าใน 2 วันแล้วปิดการทดสอบ ทั้งที่ยังไม่ถึง sample size ขั้นต่ำ ทำให้ผลลัพธ์ไม่น่าเชื่อถือ
2. ทดสอบหลายตัวแปรพร้อมกัน
เปลี่ยนทั้ง headline, รูป, ราคา และปุ่มในครั้งเดียว ทำให้ไม่รู้ว่าอะไรคือสาเหตุที่แท้จริง ควรใช้ Multivariate Testing แยกต่างหาก
3. ไม่คำนึงถึงฤดูกาล
ทดสอบช่วง 11.11 กับช่วงปกติ ผลลัพธ์ต่างกันมาก ควรทดสอบในช่วงเวลาที่ตัวแทนพฤติกรรมลูกค้าได้
4. ละเลย mobile vs desktop
ในไทย ทราฟฟิกอีคอมเมิร์ซกว่า 75% มาจากมือถือ ถ้าทดสอบแต่ desktop จะพลาด insight สำคัญ
5. ใช้ metric ผิด
วัดแค่ CTR แต่ไม่ดู CR หรือ Revenue/Session ทำให้ได้เวอร์ชันที่คนคลิกเยอะแต่ซื้อน้อย
6. ไม่มีการสุ่มที่แท้จริง
ถ้าระบบ assign กลุ่มตาม session หรือ IP อาจเกิด bias ควรใช้ cookie-based random assignment
7. ไม่บันทึกผลลัพธ์
ทดสอบเสร็จแล้วไม่ทำ documentation ทำให้ทีมอื่นทดสอบซ้ำหรือขัดแย้งกัน
(Related Terms)
- Multivariate Testing (MVT) – ทดสอบหลายตัวแปรพร้อมกันเพื่อดู interaction
- Split Testing – คำพ้องของ A/B Testing
- Conversion Rate Optimization (CRO) – กระบวนการปรับปรุงเว็บให้แปลงดีขึ้น
- Statistical Significance – ความน่าเชื่อถือทางสถิติของผลลัพธ์
- Sample Size – จำนวนตัวอย่างขั้นต่ำที่ต้องใช้
- Control Group – กลุ่มควบคุมที่ไม่ได้รับการเปลี่ยนแปลง
- Variant – กลุ่มทดลองที่ได้รับการเปลี่ยนแปลง
- Lift – เปอร์เซ็นต์การเพิ่มขึ้นของ metric
- p-value – ค่าความน่าจะเป็นที่ผลลัพธ์เกิดจากความบังเอิญ
- Personalization – การปรับประสบการณ์ตามผู้ใช้แต่ละคน
- Holdout Group – กลุ่มที่ไม่ได้เห็นการเปลี่ยนแปลงเลย ใช้เทียบระยะยาว
- Sequential Testing – การทดสอบแบบเฝ้าดูผลต่อเนื่อง (ระวัง false positive)