样本量指南
计算样本量和测试持续时间的参考。
目录
- 样本量基础(所需输入、含义)
- 样本量快速参考表
- 持续时间计算器(公式、示例、最小持续时间规则、最大持续时间指南)
- 在线计算器
- 为多个变体调整
- 常见样本量错误
- 当样本量要求过高时
- 顺序测试
- 快速决策框架
样本量基础
所需输入
- 基准转化率:你当前的转化率
- 最小可检测效应:值得检测的最小变化
- 统计显著性水平:通常 95%(α = 0.05)
- 统计功效:通常 80%(β = 0.20)
这些含义是什么
基准转化率:如果你的页面转化率为 5%,那就是你的基准。
最小可检测效应:你在乎检测到的最小改进。根据以下因素设定:
- 业务影响(5% 的提升有意义吗?)
- 实施成本(值得付出努力吗?)
- 现实预期(过往测试显示了什么?)
统计显著性(95%):意味着观察到的差异由随机机会造成的概率小于 5%。
统计功效(80%):意味着如果存在大小为最小可检测效应的真实效应,你有 80% 的概率检测到它。
样本量快速参考表
转化率:1%
| 要检测的提升 | 每变体样本 | 总样本 |
|---|---|---|
| 5%(1% → 1.05%) | 1,500,000 | 3,000,000 |
| 10%(1% → 1.1%) | 380,000 | 760,000 |
| 20%(1% → 1.2%) | 97,000 | 194,000 |
| 50%(1% → 1.5%) | 16,000 | 32,000 |
| 100%(1% → 2%) | 4,200 | 8,400 |
转化率:3%
| 要检测的提升 | 每变体样本 | 总样本 |
|---|---|---|
| 5%(3% → 3.15%) | 480,000 | 960,000 |
| 10%(3% → 3.3%) | 120,000 | 240,000 |
| 20%(3% → 3.6%) | 31,000 | 62,000 |
| 50%(3% → 4.5%) | 5,200 | 10,400 |
| 100%(3% → 6%) | 1,400 | 2,800 |
转化率:5%
| 要检测的提升 | 每变体样本 | 总样本 |
|---|---|---|
| 5%(5% → 5.25%) | 280,000 | 560,000 |
| 10%(5% → 5.5%) | 72,000 | 144,000 |
| 20%(5% → 6%) | 18,000 | 36,000 |
| 50%(5% → 7.5%) | 3,100 | 6,200 |
| 100%(5% → 10%) | 810 | 1,620 |
转化率:10%
| 要检测的提升 | 每变体样本 | 总样本 |
|---|---|---|
| 5%(10% → 10.5%) | 130,000 | 260,000 |
| 10%(10% → 11%) | 34,000 | 68,000 |
| 20%(10% → 12%) | 8,700 | 17,400 |
| 50%(10% → 15%) | 1,500 | 3,000 |
| 100%(10% → 20%) | 400 | 800 |
转化率:20%
| 要检测的提升 | 每变体样本 | 总样本 |
|---|---|---|
| 5%(20% → 21%) | 60,000 | 120,000 |
| 10%(20% → 22%) | 16,000 | 32,000 |
| 20%(20% → 24%) | 4,000 | 8,000 |
| 50%(20% → 30%) | 700 | 1,400 |
| 100%(20% → 40%) | 200 | 400 |
持续时间计算器
公式
持续时间(天)=(每变体样本 × 变体数量)/(每日流量 × 曝光比例)示例
场景 1:高流量页面
- 需要:每变体 10,000(2 个变体 = 总计 20,000)
- 每日流量:5,000 访客
- 100% 暴露于测试
- 持续时间:20,000 / 5,000 =4 天
场景 2:中等流量页面
- 需要:每变体 30,000(总计 60,000)
- 每日流量:2,000 访客
- 100% 暴露
- 持续时间:60,000 / 2,000 =30 天
场景 3:低流量部分曝光
- 需要:每变体 15,000(总计 30,000)
- 每日流量:500 访客
- 50% 暴露于测试
- 有效每日:250
- 持续时间:30,000 / 250 =120 天(太长!)
最小持续时间规则
即使有足够的样本量,也要至少运行测试:
- 1 整周:捕捉一周中的日期变化
- 2 个业务周期:如果是 B2B(工作日与周末模式)
- 经过发薪日:如果是电子商务(月初/月末)
最大持续时间指南
避免运行测试超过 4-8 周:
- 新奇效应消退
- 外部因素介入
- 其他测试的机会成本
在线计算器
推荐工具
Evan Miller 的计算器
https://www.evanmiller.org/ab-testing/sample-size.html
- 简单界面
- 值得收藏
Optimizely 的计算器
https://www.optimizely.com/sample-size-calculator/
- 对业务友好的语言
- 持续时间估算
AB Test Guide 计算器
https://www.abtestguide.com/calc/
- 包含贝叶斯选项
- 多种测试类型
VWO 持续时间计算器
https://vwo.com/tools/ab-test-duration-calculator/
- 专注于持续时间
- 适合规划
为多个变体调整
超过 2 个变体(A/B/n 测试)时,需要更多样本:
| 变体数 | 倍数 |
|---|---|
| 2(A/B) | 1x |
| 3(A/B/C) | ~1.5x |
| 4(A/B/C/D) | ~2x |
| 5+ | 考虑减少变体 |
为什么?更多比较增加了假阳性的机会。你在比较:
- A vs B
- A vs C
- B vs C(有时)
应用 Bonferroni 校正或使用自动处理此问题的工具。
常见样本量错误
1. 统计功效不足
问题:没有足够的样本来检测现实的效果
修复:对最小可检测效应要现实,获取更多流量,或者不测试
2. 统计功效过剩
问题:在已有显著性时等待样本量
修复:这实际上没问题——你承诺了样本量,就遵守它
3. 错误的基准率
问题:使用错误的转化率进行计算
修复:使用特定的指标和页面,而非全站平均值
4. 忽略分片
问题:为全部流量计算,然后分析分片
修复:如果计划进行分片分析,为最小分片计算样本
5. 测试过多内容
问题:将流量分到太多方向
修复:无情地排序,运行更少的并发测试
当样本量要求过高时
当无法获得足够流量时的选项:
- 增加最小可检测效应:仅接受检测较大效果(20%+ 提升)
- 降低置信度:使用 90% 而非 95%(有风险,需记录)
- 减少变体:仅测试最有希望的变体
- 合并流量:跨多个相似页面进行测试
- 向上游测试:在漏斗中流量更高的位置测试
- 不测试:基于定性数据做决策
- 更长的测试:接受更长的持续时间(数周/数月)
顺序测试
如果必须在达到样本量之前检查结果:
是什么?
统计方法,调整对数据的多次查看。
何时使用
- 高风险变更
- 需要尽早停止不良变体
- 时间敏感决策
支持它的工具
- Optimizely(Stats Accelerator)
- VWO(SmartStats)
- PostHog(贝叶斯方法)
权衡
- 更灵活的提前停止
- 略大的样本量要求
- 更复杂的分析
快速决策框架
我能运行这个测试吗?
页面每日流量:_____ 基准转化率:_____ 我在乎的最小可检测效应:_____ 每变体所需样本:_____(来自上表) 运行天数:样本 / 每日流量 = _____ 如果天数 > 60:考虑替代方案 如果天数 > 30:高影响测试可接受 如果天数 < 14:可能可行 如果天数 < 7:容易运行,考虑无论如何运行更长时间