ZHENESJAKOTHVIRUFRAR

Predictive Analytics

Định nghĩa

Predictive Analytics – hay phân tích dự báo – là nhóm phương pháp sử dụng thống kê, mô hình học máy (machine learning) và khai phá dữ liệu để dự đoán khả năng xảy ra của một sự kiện trong tương lai, dựa trên dữ liệu quá khứ và hiện tại.

Trong bối cảnh DTC/thương mại điện tử, predictive analytics không chỉ trả lời câu hỏi *"Chuyện gì đã xảy ra?"* (descriptive) hay *"Tại sao lại xảy ra?"* (diagnostic), mà tiến thêm một bước: *"Điều gì sẽ xảy ra tiếp theo, với xác suất bao nhiêu?"*

Ví dụ điển hình: thay vì chỉ báo cáo "tháng 10 có 12.000 đơn hàng", hệ thống dự báo cho biết "tháng 11 tới sẽ có khoảng 14.500 đơn, với khoảng tin cậy 95% là 13.800–15.200 đơn".

Ví dụ dễ hiểu (Analogy)

Hãy tưởng tượng bạn điều hành một shop thời trang online. Bạn có 3 cấp độ "nhìn":

1. Descriptive – Nhìn gương chiếu hậu: "Tháng trước bán được 8.000 áo thun."

2. Diagnostic – Mở nắp capo: "Bán chạy vì chạy TikTok Ads ngày 12/10."

3. Predictive – Nhìn kính chắn gió: "Nếu giữ ngân sách ads hiện tại, tháng sau sẽ bán khoảng 9.200 áo, nhưng nếu tăng 20% ngân sách vào 3 ngày cuối tháng, có thể đạt 11.000 áo."

Predictive analytics chính là "kính chắn gió" đó – không đảm bảo chính xác 100%, nhưng giúp bạn ra quyết định trước khi sự việc xảy ra, thay vì chữa cháy sau khi đã cháy.

Công thức cốt lõi

Phần lớn mô hình dự báo trong e-commerce xoay quanh hồi quy tuyến tính và xác suất có điều kiện.

1. Hồi quy tuyến tính đa biến (dự báo doanh thu):

$$

\hat{y} = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \beta_n x_n + \varepsilon

$$

Trong đó:

- $\hat{y}$: giá trị dự báo (ví dụ: doanh thu ngày mai)

- $x_1, x_2, \dots$: biến đầu vào (traffic, ad spend, tồn kho, mùa vụ)

- $\beta_i$: hệ số học được từ dữ liệu lịch sử

- $\varepsilon$: sai số ngẫu nhiên

2. Xác suất churn (khách rời bỏ) – Logistic Regression:

$$

P(\text{churn}) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \dots + \beta_n x_n)}}

$$

Kết quả luôn nằm trong khoảng $[0, 1]$ – đúng dạng xác suất.

3. RFM + CLV (Customer Lifetime Value):

$$

\text{CLV} = \frac{\text{AOV} \times \text{Frequency} \times \text{Retention Rate}}{1 + \text{Discount Rate} - \text{Retention Rate}}

$$

Ví dụ thực tế: AOV = 450.000đ, tần suất mua = 4 lần/năm, retention = 60%, discount rate = 10% → CLV ≈ 3.375.000đ/khách.

Bảng so sánh 4 cấp độ phân tích

Cấp độCâu hỏi trả lờiCông cụ điển hìnhVí dụ DTC
**Descriptive**Chuyện gì đã xảy ra?Dashboard, GA4, SQLDoanh thu tháng 10 = 4,2 tỷ
**Diagnostic**Tại sao?Cohort, funnel analysisDrop-off ở bước thanh toán tăng 18%
**Predictive**Điều gì sắp xảy ra?Regression, Random Forest, XGBoostDự báo 30 ngày tới: 4,8 tỷ ± 5%
**Prescriptive**Nên làm gì?Optimization, A/B testingTăng bid 15% cho nhóm khách RFM cao

Ứng dụng thực tế trong DTC/Thương mại điện tử Việt Nam

1. Dự báo nhu cầu & tồn kho (Demand Forecasting)

Một brand mỹ phẩm nội địa dùng mô hình Prophet để dự báo SKU theo tuần. Kết quả: giảm 32% hàng tồn kho chết và giảm 27% tình trạng hết hàng trong dịp 11.11.

2. Dự đoán churn & retention

Với tệp khách hàng có chu kỳ mua lại 45 ngày, mô hình phân loại khách có xác suất churn > 0,7 trong 14 ngày tới. Nhóm này được đẩy vào flow Zalo ZNS + voucher 50.000đ. Tỷ lệ quay lại tăng từ 12% lên 23%.

3. Dự báo LTV theo kênh acquisition

Không phải khách từ TikTok Ads nào cũng sinh lời như nhau. Mô hình cho thấy khách từ TikTok có LTV 6 tháng thấp hơn 41% so với khách từ SEO organic – dù CPA rẻ hơn. Quyết định: dịch ngân sách 25% sang content SEO.

4. Dự báo rời bỏ giỏ hàng (Cart Abandonment Prediction)

Dựa trên session behavior (thời gian, số lần scroll, có nhập mã giảm giá hay không), mô hình dự báo khả năng bỏ giỏ. Nếu > 0,65 → trigger popup giữ chân ngay lập tức. Tỷ lệ cứu giỏ tăng 19%.

5. Upsell/Cross-sell cá nhân hóa

Recommendation engine dự báo sản phẩm nào khách có khả năng mua kèm cao nhất. AOV tăng trung bình 14% sau 3 tháng triển khai.

Những hiểu lầm phổ biến

❌ "Predictive analytics là tiên tri chính xác"

Không. Mọi dự báo đều có sai số. Điều quan trọng là khoảng tin cậy và hướng đi, không phải con số tuyệt đối. Một dự báo "doanh thu tháng sau 4,8 tỷ ± 8%" hữu ích hơn "chính xác 4.800.000.000đ".

❌ "Cần big data mới làm được"

Sai. Với 10.000–50.000 đơn hàng lịch sử, bạn đã có thể xây mô hình churn hoặc demand forecasting khá tốt bằng Python + scikit-learn.

❌ "Cứ dùng AI/Deep Learning là ngon"

Với dữ liệu DTC quy mô vừa, XGBoost hoặc Logistic Regression thường thắng Deep Learning vì ít overfitting và dễ giải thích. Đừng đốt tiền vào model phức tạp khi baseline chưa tối ưu.

❌ "Dự báo xong là xong"

Model drift theo thời gian. Hành vi khách thay đổi sau mỗi mùa sale, sau mỗi thay đổi thuật toán ads. Cần retrain định kỳ 2–4 tuần/lần.

❌ "Chỉ team Data mới cần quan tâm"

Sai. Founder, Head of Growth, Category Manager đều phải đọc được output dự báo để ra quyết định. Nếu chỉ Data hiểu, giá trị = 0.

Các chỉ số & con số cần nhớ

- MAPE (Mean Absolute Percentage Error): dưới 15% là tốt cho demand forecasting DTC.

- AUC-ROC cho mô hình churn: trên 0,75 là khả dụng, trên 0,85 là xuất sắc.

- Thời gian retrain: 14–30 ngày cho mô hình hành vi; 7 ngày cho mô hình pricing.

- ROI điển hình: doanh nghiệp DTC áp dụng predictive analytics bài bản thường tăng 15–25% biên lợi nhuận trong 12 tháng đầu.

Thuật ngữ liên quan

- Descriptive Analytics – phân tích mô tả

- Prescriptive Analytics – phân tích đề xuất

- Machine Learning – học máy

- Customer Lifetime Value (CLV/LTV) – giá trị vòng đời khách hàng

- Churn Prediction – dự báo rời bỏ

- Demand Forecasting – dự báo nhu cầu

- RFM Segmentation – phân khúc theo Recency–Frequency–Monetary

- Cohort Analysis – phân tích nhóm thuần tập

- Feature Engineering – xây dựng đặc trưng cho mô hình

- Model Drift – mô hình bị lệch theo thời gian