ZHENESJAKOTHVIRUFRAR

A/B测试

一句话解释:A/B测试是把同一批目标用户随机分成两组,分别展示两个版本的页面或功能,用真实数据判断哪个版本更能达成目标(如转化、点击、加购)的方法。

生活化类比

想象你开了一家奶茶店,想测试“第二杯半价”和“买一送一”哪个更能拉动销量。你不会凭感觉拍板,而是把一周的顾客随机分成两组:A组看到“第二杯半价”,B组看到“买一送一”,其他条件(价格、口味、门店环境)完全一致。一周后对比两组的购买率,谁高就用谁。A/B测试就是这套“公平比较”的逻辑搬到线上。

核心概念/公式

- 对照组(A):当前版本(基准)。

- 实验组(B):新版本(变量)。

- 流量分割:通常 50/50,也可 70/30。

- 核心指标:转化率、点击率、客单价、加购率等。

- 统计显著性:判断差异是否由随机波动造成,常用 95% 置信水平(p < 0.05)。

- 提升幅度(Lift):

\[

\text{Lift} = \frac{\text{B组转化率} - \text{A组转化率}}{\text{A组转化率}} \times 100\%

\]

- 样本量:需提前计算,避免“跑两天就下结论”。

与相关术语对比

术语定义与A/B测试的关系
多变量测试同时测试多个元素组合A/B测试的扩展,变量更多
灰度发布向小部分用户推新版本目的偏“降风险”,A/B偏“比效果”
用户分群按属性划分用户A/B测试可结合分群做分层分析
漏斗分析看各环节流失A/B测试常用来优化漏斗某一步
归因分析判断渠道/触点贡献与A/B测试互补,解释“为什么”

应用场景(含数据/案例)

1. 独立站首页CTA按钮

某家居独立站把“Shop Now”改成“Get 10% Off”,A组转化率 2.1%,B组 2.6%,Lift = 23.8%,按 95% 置信水平显著,月增约 180 单。

2. Shopify结账页

某服饰站测试“显示运费”vs“免运费门槛提示”。B组结账完成率从 61% 提升到 68%,客单价从 $52 升到 $58,整体 GMV 提升约 14%。

3. 广告落地页

某3C配件站测试“视频头图”vs“静态图”。视频组停留时长 48 秒 vs 32 秒,加购率 7.2% vs 5.4%,但最终转化率仅差 0.3%,说明“好看”不等于“好卖”。

4. 邮件标题

某DTC品牌测试标题含“限时”vs“新品”。限时组打开率 28%,新品组 22%,但点击率接近,说明紧迫感主要影响打开。

常见误区

- 只看结果不看显著性:差 0.1% 就上线,可能只是随机波动。

- 样本量不足:每天 50 个访客就跑测试,结论不可靠。

- 同时改多个变量:无法判断是哪个改动起作用。

- 测试时间太短:忽略周末/工作日差异,至少跑 7 天或 1 个完整周期。

- 只测一次就定论:用户行为会变,需持续迭代。

- 忽略业务指标:点击率涨了但退货率也涨,可能得不偿失。

相关术语

- 统计显著性

- 置信区间

- 样本量计算

- 转化率优化(CRO)

- 多变量测试

- 灰度发布

- 用户分群

- 漏斗分析

- 归因分析

- 落地页优化