ZHENESJAKOTHVIRUFRAR

Sample Size

Định nghĩa

Sample Size (cỡ mẫu) là số lượng cá thể, lượt truy cập, đơn hàng hoặc người dùng được đưa vào một thử nghiệm hay khảo sát. Nói cách khác, đó là “số lượng quan sát” mà bạn dùng để đưa ra kết luận.

Trong DTC/e-commerce, cỡ mẫu thường xuất hiện ở các dạng:

- Số phiên (sessions) trong một A/B test landing page

- Số người nhận email trong một chiến dịch split test subject line

- Số đơn hàng trong một test giá sản phẩm

- Số khách hàng trong một khảo sát NPS sau mua

Cỡ mẫu càng lớn thì kết quả càng ổn định, nhưng chi phí và thời gian cũng tăng theo. Mục tiêu không phải là “càng nhiều càng tốt”, mà là đủ lớn để phát hiện hiệu ứng có ý nghĩa thực tế.


Ví dụ dễ hiểu

Bạn muốn biết công thức subject line mới có tăng open rate không. Bạn gửi email cho 200 người:

- Nhóm A: 100 người, open rate 22%

- Nhóm B: 100 người, open rate 26%

Chênh lệch 4 điểm phần trăm nghe có vẻ thắng. Nhưng với 100 người mỗi nhóm, chỉ cần 4 người mở hoặc không mở khác đi là kết quả đã đảo chiều. Cỡ mẫu 100 quá nhỏ để kết luận chắc chắn.

Nếu bạn gửi cho 20.000 người, chia đều 10.000 mỗi nhóm, chênh lệch 4 điểm phần trăm sẽ đáng tin hơn nhiều. Cỡ mẫu lớn giúp bạn phân biệt tín hiệu thật với nhiễu ngẫu nhiên.


Công thức cần nhớ

Với tỷ lệ (conversion rate, open rate, CTR), công thức ước lượng cỡ mẫu cho mỗi nhánh trong A/B test là:

\[

n = \frac{2 \cdot (Z_{\alpha/2} + Z_{\beta})^2 \cdot p(1-p)}{\Delta^2}

\]

Trong đó:

- \(n\): cỡ mẫu mỗi nhánh

- \(Z_{\alpha/2} = 1.96\) với độ tin cậy 95%

- \(Z_{\beta} = 0.84\) với power 80%

- \(p\): tỷ lệ nền hiện tại (baseline conversion rate)

- \(\Delta\): mức tăng tối thiểu bạn muốn phát hiện (minimum detectable effect)

Ví dụ thực tế:

- Baseline conversion rate \(p = 3\%\) (0.03)

- Bạn muốn phát hiện mức tăng lên 3.6%, tức \(\Delta = 0.6\%\) (0.006)

- \(n = \frac{2 \cdot (1.96 + 0.84)^2 \cdot 0.03 \cdot 0.97}{0.006^2} \approx 12,700\) người mỗi nhánh

Nghĩa là bạn cần khoảng 25.400 người tổng cộng cho test này. Nếu traffic của bạn chỉ 300 người/ngày, test sẽ mất gần 85 ngày — quá dài để còn ý nghĩa.


Bảng so sánh: Cỡ mẫu nhỏ vs. lớn

Tiêu chíCỡ mẫu nhỏ (dưới 1.000)Cỡ mẫu lớn (trên 10.000)
Độ tin cậyThấp, dễ saiCao, ổn định hơn
Khả năng phát hiện hiệu ứng nhỏKémTốt
Chi phí & thời gianThấpCao
Rủi ro kết luận saiCao (false positive/negative)Thấp hơn
Phù hợpTest nhanh, giả thuyết lớnQuyết định ngân sách, scale

Ứng dụng trong DTC/e-commerce

1. A/B test giá sản phẩm

Bạn muốn test giá 499.000đ vs. 549.000đ. Với baseline conversion 2%, để phát hiện chênh lệch 0.5 điểm phần trăm, bạn cần khoảng 8.000–10.000 phiên mỗi nhánh. Nếu không đủ, kết quả chỉ là may mắn.

2. Test creative quảng cáo Facebook

CTR baseline 1.2%, muốn phát hiện tăng lên 1.5%. Cỡ mẫu cần khoảng 15.000 impressions mỗi nhánh. Nhiều advertiser tắt ads sau 2.000 impressions và kết luận sai.

3. Khảo sát NPS sau mua

Bạn có 50.000 khách hàng. Gửi khảo sát cho 5.000 người, tỷ lệ phản hồi 12% → 600 phản hồi. Với 600 mẫu, sai số biên khoảng ±4% ở độ tin cậy 95%. Đủ để theo dõi xu hướng, chưa đủ để kết luận về từng phân khúc nhỏ.

4. Test email subject line

Danh sách 30.000 subscribers. Chia 10.000/10.000, giữ 10.000 cho roll-out. Cỡ mẫu này đủ để phát hiện chênh lệch open rate từ 1.5 điểm phần trăm trở lên.


Lỗi thường gặp

1. Dừng test quá sớm

Xem kết quả sau 2 ngày, thấy nhóm B thắng 15%, liền scale. Đây là lỗi phổ biến nhất. Cỡ mẫu chưa đủ thì kết quả chỉ là nhiễu.

2. Không tính cỡ mẫu trước khi chạy

Chạy test rồi mới hỏi “cần bao nhiêu mới đủ?”. Đúng quy trình là tính trước, cam kết thời gian, rồi mới chạy.

3. Bỏ qua baseline rate

Cùng một mức tăng 0.5%, nhưng baseline 1% cần cỡ mẫu lớn hơn nhiều so với baseline 10%. Không có baseline, không tính được cỡ mẫu.

4. Nhầm statistical significance với practical significance

Với cỡ mẫu 1 triệu, chênh lệch 0.01% cũng có thể “significant”. Nhưng nếu lợi nhuận tăng thêm không bù được chi phí, nó không có ý nghĩa thực tế.

5. Chia nhóm không đều

Nếu nhóm A có 10.000 người, nhóm B chỉ 2.000, power giảm mạnh. Luôn chia đều trừ khi có lý do đặc biệt.

6. Peeking — nhìn kết quả liên tục

Mỗi lần nhìn và quyết định dừng, bạn đang tăng xác suất false positive. Nếu cần theo dõi, dùng sequential testing có điều chỉnh.


Mẹo thực chiến cho người làm DTC

- Tính cỡ mẫu trước, dùng công cụ như Evan Miller, Optimizely, hoặc công thức trên.

- Đặt MDE (minimum detectable effect) theo lợi nhuận, không theo cảm tính. Nếu cần tăng 0.3% conversion mới có lãi, đó là MDE của bạn.

- Với traffic nhỏ, đừng test những thứ cần cỡ mẫu lớn. Tập trung vào thay đổi lớn (offer, giá, positioning) thay vì test màu nút.

- Ghi log cỡ mẫu mục tiêu trước khi chạy, để không tự lừa mình.

- Kết hợp qualitative + quantitative: 600 phản hồi khảo sát + 10 phỏng vấn sâu thường hữu ích hơn 6.000 phản hồi khảo sát đơn thuần.


Thuật ngữ liên quan

- Statistical Power (Power thống kê): xác suất phát hiện hiệu ứng thật nếu nó tồn tại. Thường đặt 80%.

- Confidence Level (Độ tin cậy): thường 95%, tương ứng \(Z = 1.96\).

- Minimum Detectable Effect (MDE): mức chênh lệch nhỏ nhất bạn muốn phát hiện.

- P-value: xác suất quan sát kết quả cực đoan như vậy nếu giả thuyết null đúng.

- Baseline Conversion Rate: tỷ lệ chuyển đổi hiện tại trước khi test.

- Sequential Testing: phương pháp cho phép nhìn kết quả nhiều lần mà không làm hỏng độ tin cậy.

- Statistical Significance (Ý nghĩa thống kê): kết quả khó xảy ra do ngẫu nhiên, thường p < 0.05.


Tóm lại: Cỡ mẫu là nền tảng của mọi quyết định dựa trên dữ liệu. Tính đúng cỡ mẫu trước khi chạy test giúp bạn tiết kiệm tiền, tránh scale sai hướng, và ra quyết định tự tin hơn. Với DTC/e-commerce, nơi mỗi điểm phần trăm conversion đều ảnh hưởng đến lợi nhuận, đây là kỹ năng không thể bỏ qua.