ZHENESJAKOTHVIRUFRAR

样本量

样本量(Sample Size)是指在一次实验、调查或数据分析中,实际纳入统计的观测个体(用户、订单、点击、SKU 等)的数量。它直接决定了你的结论有多“稳”——样本量越大,随机波动被平均掉的程度越高,结果越可靠、越容易达到统计显著性。

一句话解释

样本量就是你“看了多少个样本”再下结论;看得太少,结论容易被运气带偏,看得太多,又浪费时间和预算。

生活化类比

假设你想知道一锅汤咸不咸。舀一勺尝(样本量 = 1),可能刚好舀到没搅匀的盐块,结论就错了;舀 10 勺从不同位置尝(样本量 = 10),判断就靠谱得多。但如果你只想知道“这锅汤要不要加水”,尝 1000 勺也没必要——够用就好。跨境电商里同理:用 20 个访客判断落地页好坏,几乎等于抛硬币;用 20,000 个访客判断,结论才可信。

核心概念与公式

样本量的核心逻辑是:你希望检测到的差异越小、要求的置信度越高,需要的样本量就越大。

以最常见的 A/B 测试(两组比例对比)为例,每组所需样本量的简化估算公式为:

\[

n = \frac{2 \cdot (z_{\alpha/2} + z_{\beta})^2 \cdot p(1-p)}{\Delta^2}

\]

其中:

- \(n\):每组所需样本量

- \(z_{\alpha/2}\):显著性水平对应的临界值(95% 置信度约 1.96)

- \(z_{\beta}\):统计功效对应的临界值(80% 功效约 0.84)

- \(p\):基准转化率

- \(\Delta\):你希望检测到的最小提升幅度(绝对值)

三个关键数据示例:

1. 基准转化率 5%,希望检测到提升到 6%(\(\Delta=1\%\)),95% 置信度、80% 功效 → 每组约需 7,000+ 样本。

2. 若只想检测 5% → 7%(\(\Delta=2\%\)),每组约需 1,800 左右。

3. 若基准转化率 1%,检测 1% → 1.5%(\(\Delta=0.5\%\)),每组可能需要 数万样本。

可以看出:转化率越低、想检测的提升越小,样本量需求呈平方级增长。

与相关术语对比

术语含义与样本量的关系
总体(Population)你真正想研究的全部对象,如所有潜在买家样本量是从总体中抽取的观测数量
抽样(Sampling)从总体中选取部分个体的过程抽样方式影响样本量的有效性
统计功效(Power)当真实差异存在时,能检测出它的概率功效越高,所需样本量越大
显著性水平(α)允许犯“假阳性”错误的概率,常取 0.05α 越小,所需样本量越大
置信区间(CI)估计值的可能范围样本量越大,置信区间越窄
最小可检测效应(MDE)你希望检测到的最小差异MDE 越小,所需样本量越大

应用场景(含数据与案例)

场景 1:落地页 A/B 测试

某独立站落地页基准转化率 4%,你希望检测新版本能否提升到 4.8%(相对提升 20%)。按 95% 置信度、80% 功效计算,每组约需 9,000 访客。若你每天只有 300 访客,两组并行需要约 60 天——这时要么延长测试,要么接受更大的 MDE。

场景 2:广告素材效果对比

某 Facebook 广告组 CTR 基准 1.2%,你想判断新素材是否能提升到 1.5%。由于基准低、差异小,每组可能需要 2 万以上曝光。很多卖家投了 2,000 曝光就下结论“新素材不行”,实际上样本量远远不够。

场景 3:问卷调研

你想了解海外用户对某品类的价格敏感度,若总体假设为无限大、允许误差 ±5%、置信度 95%,所需样本量约为 384 份。若只回收 80 份,误差范围会扩大到 ±11% 左右,结论参考价值大幅下降。

常见误区

1. “样本量越大越好”:不是。样本量超过必要值会浪费流量和预算,还可能把极小的、无商业意义的差异判为“显著”。

2. “有数据就能下结论”:样本量不足时,随机波动会主导结果。100 个访客的转化率差异,可能只是运气。

3. “看相对提升就够了”:5% → 5.5% 是相对提升 10%,但绝对差异只有 0.5%,所需样本量远大于 5% → 10%。

4. “中途偷看结果,显著就停”:这会大幅提高假阳性率(peeking problem)。应预先算好样本量并跑完。

5. “忽略基准转化率”:低转化率场景(如 1%)需要的样本量远高于高转化率场景(如 10%)。

相关术语

- 统计功效(Statistical Power)

- 显著性水平(Significance Level / α)

- 最小可检测效应(MDE)

- 置信区间(Confidence Interval)

- P 值(P-value)

- 抽样偏差(Sampling Bias)

- A/B 测试(A/B Testing)

- 统计显著性(Statistical Significance)