样本量(Sample Size)是指在一次实验、调查或数据分析中,实际纳入统计的观测个体(用户、订单、点击、SKU 等)的数量。它直接决定了你的结论有多“稳”——样本量越大,随机波动被平均掉的程度越高,结果越可靠、越容易达到统计显著性。
一句话解释
样本量就是你“看了多少个样本”再下结论;看得太少,结论容易被运气带偏,看得太多,又浪费时间和预算。
生活化类比
假设你想知道一锅汤咸不咸。舀一勺尝(样本量 = 1),可能刚好舀到没搅匀的盐块,结论就错了;舀 10 勺从不同位置尝(样本量 = 10),判断就靠谱得多。但如果你只想知道“这锅汤要不要加水”,尝 1000 勺也没必要——够用就好。跨境电商里同理:用 20 个访客判断落地页好坏,几乎等于抛硬币;用 20,000 个访客判断,结论才可信。
核心概念与公式
样本量的核心逻辑是:你希望检测到的差异越小、要求的置信度越高,需要的样本量就越大。
以最常见的 A/B 测试(两组比例对比)为例,每组所需样本量的简化估算公式为:
\[
n = \frac{2 \cdot (z_{\alpha/2} + z_{\beta})^2 \cdot p(1-p)}{\Delta^2}
\]
其中:
- \(n\):每组所需样本量
- \(z_{\alpha/2}\):显著性水平对应的临界值(95% 置信度约 1.96)
- \(z_{\beta}\):统计功效对应的临界值(80% 功效约 0.84)
- \(p\):基准转化率
- \(\Delta\):你希望检测到的最小提升幅度(绝对值)
三个关键数据示例:
1. 基准转化率 5%,希望检测到提升到 6%(\(\Delta=1\%\)),95% 置信度、80% 功效 → 每组约需 7,000+ 样本。
2. 若只想检测 5% → 7%(\(\Delta=2\%\)),每组约需 1,800 左右。
3. 若基准转化率 1%,检测 1% → 1.5%(\(\Delta=0.5\%\)),每组可能需要 数万样本。
可以看出:转化率越低、想检测的提升越小,样本量需求呈平方级增长。
与相关术语对比
| 术语 | 含义 | 与样本量的关系 |
|---|---|---|
| 总体(Population) | 你真正想研究的全部对象,如所有潜在买家 | 样本量是从总体中抽取的观测数量 |
| 抽样(Sampling) | 从总体中选取部分个体的过程 | 抽样方式影响样本量的有效性 |
| 统计功效(Power) | 当真实差异存在时,能检测出它的概率 | 功效越高,所需样本量越大 |
| 显著性水平(α) | 允许犯“假阳性”错误的概率,常取 0.05 | α 越小,所需样本量越大 |
| 置信区间(CI) | 估计值的可能范围 | 样本量越大,置信区间越窄 |
| 最小可检测效应(MDE) | 你希望检测到的最小差异 | MDE 越小,所需样本量越大 |
应用场景(含数据与案例)
场景 1:落地页 A/B 测试
某独立站落地页基准转化率 4%,你希望检测新版本能否提升到 4.8%(相对提升 20%)。按 95% 置信度、80% 功效计算,每组约需 9,000 访客。若你每天只有 300 访客,两组并行需要约 60 天——这时要么延长测试,要么接受更大的 MDE。
场景 2:广告素材效果对比
某 Facebook 广告组 CTR 基准 1.2%,你想判断新素材是否能提升到 1.5%。由于基准低、差异小,每组可能需要 2 万以上曝光。很多卖家投了 2,000 曝光就下结论“新素材不行”,实际上样本量远远不够。
场景 3:问卷调研
你想了解海外用户对某品类的价格敏感度,若总体假设为无限大、允许误差 ±5%、置信度 95%,所需样本量约为 384 份。若只回收 80 份,误差范围会扩大到 ±11% 左右,结论参考价值大幅下降。
常见误区
1. “样本量越大越好”:不是。样本量超过必要值会浪费流量和预算,还可能把极小的、无商业意义的差异判为“显著”。
2. “有数据就能下结论”:样本量不足时,随机波动会主导结果。100 个访客的转化率差异,可能只是运气。
3. “看相对提升就够了”:5% → 5.5% 是相对提升 10%,但绝对差异只有 0.5%,所需样本量远大于 5% → 10%。
4. “中途偷看结果,显著就停”:这会大幅提高假阳性率(peeking problem)。应预先算好样本量并跑完。
5. “忽略基准转化率”:低转化率场景(如 1%)需要的样本量远高于高转化率场景(如 10%)。
相关术语
- 统计功效(Statistical Power)
- 显著性水平(Significance Level / α)
- 最小可检测效应(MDE)
- 置信区间(Confidence Interval)
- P 值(P-value)
- 抽样偏差(Sampling Bias)
- A/B 测试(A/B Testing)
- 统计显著性(Statistical Significance)