Định nghĩa
Sample Size (cỡ mẫu) là số lượng cá thể, lượt truy cập, đơn hàng hoặc người dùng được đưa vào một thử nghiệm hay khảo sát. Nói cách khác, đó là “số lượng quan sát” mà bạn dùng để đưa ra kết luận.
Trong DTC/e-commerce, cỡ mẫu thường xuất hiện ở các dạng:
- Số phiên (sessions) trong một A/B test landing page
- Số người nhận email trong một chiến dịch split test subject line
- Số đơn hàng trong một test giá sản phẩm
- Số khách hàng trong một khảo sát NPS sau mua
Cỡ mẫu càng lớn thì kết quả càng ổn định, nhưng chi phí và thời gian cũng tăng theo. Mục tiêu không phải là “càng nhiều càng tốt”, mà là đủ lớn để phát hiện hiệu ứng có ý nghĩa thực tế.
Ví dụ dễ hiểu
Bạn muốn biết công thức subject line mới có tăng open rate không. Bạn gửi email cho 200 người:
- Nhóm A: 100 người, open rate 22%
- Nhóm B: 100 người, open rate 26%
Chênh lệch 4 điểm phần trăm nghe có vẻ thắng. Nhưng với 100 người mỗi nhóm, chỉ cần 4 người mở hoặc không mở khác đi là kết quả đã đảo chiều. Cỡ mẫu 100 quá nhỏ để kết luận chắc chắn.
Nếu bạn gửi cho 20.000 người, chia đều 10.000 mỗi nhóm, chênh lệch 4 điểm phần trăm sẽ đáng tin hơn nhiều. Cỡ mẫu lớn giúp bạn phân biệt tín hiệu thật với nhiễu ngẫu nhiên.
Công thức cần nhớ
Với tỷ lệ (conversion rate, open rate, CTR), công thức ước lượng cỡ mẫu cho mỗi nhánh trong A/B test là:
\[
n = \frac{2 \cdot (Z_{\alpha/2} + Z_{\beta})^2 \cdot p(1-p)}{\Delta^2}
\]
Trong đó:
- \(n\): cỡ mẫu mỗi nhánh
- \(Z_{\alpha/2} = 1.96\) với độ tin cậy 95%
- \(Z_{\beta} = 0.84\) với power 80%
- \(p\): tỷ lệ nền hiện tại (baseline conversion rate)
- \(\Delta\): mức tăng tối thiểu bạn muốn phát hiện (minimum detectable effect)
Ví dụ thực tế:
- Baseline conversion rate \(p = 3\%\) (0.03)
- Bạn muốn phát hiện mức tăng lên 3.6%, tức \(\Delta = 0.6\%\) (0.006)
- \(n = \frac{2 \cdot (1.96 + 0.84)^2 \cdot 0.03 \cdot 0.97}{0.006^2} \approx 12,700\) người mỗi nhánh
Nghĩa là bạn cần khoảng 25.400 người tổng cộng cho test này. Nếu traffic của bạn chỉ 300 người/ngày, test sẽ mất gần 85 ngày — quá dài để còn ý nghĩa.
Bảng so sánh: Cỡ mẫu nhỏ vs. lớn
| Tiêu chí | Cỡ mẫu nhỏ (dưới 1.000) | Cỡ mẫu lớn (trên 10.000) |
|---|---|---|
| Độ tin cậy | Thấp, dễ sai | Cao, ổn định hơn |
| Khả năng phát hiện hiệu ứng nhỏ | Kém | Tốt |
| Chi phí & thời gian | Thấp | Cao |
| Rủi ro kết luận sai | Cao (false positive/negative) | Thấp hơn |
| Phù hợp | Test nhanh, giả thuyết lớn | Quyết định ngân sách, scale |
Ứng dụng trong DTC/e-commerce
1. A/B test giá sản phẩm
Bạn muốn test giá 499.000đ vs. 549.000đ. Với baseline conversion 2%, để phát hiện chênh lệch 0.5 điểm phần trăm, bạn cần khoảng 8.000–10.000 phiên mỗi nhánh. Nếu không đủ, kết quả chỉ là may mắn.
2. Test creative quảng cáo Facebook
CTR baseline 1.2%, muốn phát hiện tăng lên 1.5%. Cỡ mẫu cần khoảng 15.000 impressions mỗi nhánh. Nhiều advertiser tắt ads sau 2.000 impressions và kết luận sai.
3. Khảo sát NPS sau mua
Bạn có 50.000 khách hàng. Gửi khảo sát cho 5.000 người, tỷ lệ phản hồi 12% → 600 phản hồi. Với 600 mẫu, sai số biên khoảng ±4% ở độ tin cậy 95%. Đủ để theo dõi xu hướng, chưa đủ để kết luận về từng phân khúc nhỏ.
4. Test email subject line
Danh sách 30.000 subscribers. Chia 10.000/10.000, giữ 10.000 cho roll-out. Cỡ mẫu này đủ để phát hiện chênh lệch open rate từ 1.5 điểm phần trăm trở lên.
Lỗi thường gặp
1. Dừng test quá sớm
Xem kết quả sau 2 ngày, thấy nhóm B thắng 15%, liền scale. Đây là lỗi phổ biến nhất. Cỡ mẫu chưa đủ thì kết quả chỉ là nhiễu.
2. Không tính cỡ mẫu trước khi chạy
Chạy test rồi mới hỏi “cần bao nhiêu mới đủ?”. Đúng quy trình là tính trước, cam kết thời gian, rồi mới chạy.
3. Bỏ qua baseline rate
Cùng một mức tăng 0.5%, nhưng baseline 1% cần cỡ mẫu lớn hơn nhiều so với baseline 10%. Không có baseline, không tính được cỡ mẫu.
4. Nhầm statistical significance với practical significance
Với cỡ mẫu 1 triệu, chênh lệch 0.01% cũng có thể “significant”. Nhưng nếu lợi nhuận tăng thêm không bù được chi phí, nó không có ý nghĩa thực tế.
5. Chia nhóm không đều
Nếu nhóm A có 10.000 người, nhóm B chỉ 2.000, power giảm mạnh. Luôn chia đều trừ khi có lý do đặc biệt.
6. Peeking — nhìn kết quả liên tục
Mỗi lần nhìn và quyết định dừng, bạn đang tăng xác suất false positive. Nếu cần theo dõi, dùng sequential testing có điều chỉnh.
Mẹo thực chiến cho người làm DTC
- Tính cỡ mẫu trước, dùng công cụ như Evan Miller, Optimizely, hoặc công thức trên.
- Đặt MDE (minimum detectable effect) theo lợi nhuận, không theo cảm tính. Nếu cần tăng 0.3% conversion mới có lãi, đó là MDE của bạn.
- Với traffic nhỏ, đừng test những thứ cần cỡ mẫu lớn. Tập trung vào thay đổi lớn (offer, giá, positioning) thay vì test màu nút.
- Ghi log cỡ mẫu mục tiêu trước khi chạy, để không tự lừa mình.
- Kết hợp qualitative + quantitative: 600 phản hồi khảo sát + 10 phỏng vấn sâu thường hữu ích hơn 6.000 phản hồi khảo sát đơn thuần.
Thuật ngữ liên quan
- Statistical Power (Power thống kê): xác suất phát hiện hiệu ứng thật nếu nó tồn tại. Thường đặt 80%.
- Confidence Level (Độ tin cậy): thường 95%, tương ứng \(Z = 1.96\).
- Minimum Detectable Effect (MDE): mức chênh lệch nhỏ nhất bạn muốn phát hiện.
- P-value: xác suất quan sát kết quả cực đoan như vậy nếu giả thuyết null đúng.
- Baseline Conversion Rate: tỷ lệ chuyển đổi hiện tại trước khi test.
- Sequential Testing: phương pháp cho phép nhìn kết quả nhiều lần mà không làm hỏng độ tin cậy.
- Statistical Significance (Ý nghĩa thống kê): kết quả khó xảy ra do ngẫu nhiên, thường p < 0.05.
Tóm lại: Cỡ mẫu là nền tảng của mọi quyết định dựa trên dữ liệu. Tính đúng cỡ mẫu trước khi chạy test giúp bạn tiết kiệm tiền, tránh scale sai hướng, và ra quyết định tự tin hơn. Với DTC/e-commerce, nơi mỗi điểm phần trăm conversion đều ảnh hưởng đến lợi nhuận, đây là kỹ năng không thể bỏ qua.