统计百科 ·
样本量经验法则(10倍/30个)靠谱吗?功效分析才是科学答案
统计百科:破除"每个预测变量10个样本""至少30个"等经验法则的迷思,系统讲解功效分析(power analysis)如何科学确定样本量,给出可抄进论文的APA报告句式,落点ChatSRS一键计算。
每个预测变量至少 10 个样本?总样本量至少 30 个?这类经验法则流传极广,却没有坚实的统计学依据。用错了要么白白浪费资源,要么样本量严重不足导致论文被拒。本文从统计功效(statistical power)出发,系统讲解功效分析如何科学确定样本量,并给出可直接套用的 APA 7th 报告模板。
一、经验法则从哪里来,为什么它不可靠
1.1 最常见的三条经验法则
在研究生课堂和论文写作指南里,下面几条话几乎人尽皆知:
- "每个预测变量至少 10 个样本"(10:1 rule):用于多元回归,流传最广。
- "至少 30 个总样本":声称由中心极限定理保证正态性。
- "每组至少 30 人":用于 t 检验或 ANOVA 的各组要求。
1.2 这些法则的真实来源
Green(1991)提出了回归样本量的两条启发式规则:N ≥ 50 + 8m(检验整体模型)和 N ≥ 104 + m(检验单个预测变量,m 为预测变量数量)。这两条规则本身就假定了中等效应量(f² ≈ .15)和 80% 功效。被口耳相传之后,"104 + m"被简化成了"10倍",效应量和功效的前提条件彻底消失了。
"30个样本"的说法则更为模糊,与中心极限定理(CLT)的关系被严重夸大。CLT 保证的是随样本量增大均值的渐近正态性,而非"30个样本就够了"——这一数字在高度偏态分布或小效应量时根本不成立(Wilcox, 2012)。
1.3 经验法则失效的典型场景
| 场景 | 用经验法则 | 实际需要 | 后果 |
|---|---|---|---|
| 小效应量回归(f² = .02),5个预测变量 | ~50 人 | ~395 人(80% 功效) | 严重欠检验,I 类错误虚高 |
| 大效应量 t 检验(d = 1.2),两组 | 30人/组 | 12人/组(80% 功效) | 资源浪费 |
| 中效应量 ANOVA(f = .25),4 组 | 30人/组 | 45人/组(80% 功效) | 漏检真实效应 |
| 相关系数检验(r = .10) | 30 人 | 782 人(80% 功效) | 样本量差出25倍以上 |
二、功效分析的核心逻辑
2.1 四个相互制约的参数
功效分析(power analysis)描述的是以下四个参数之间的关系,确定其中三个,第四个随之确定:
- 效应量(effect size):总体中真实差异或关联的大小(如 Cohen's d、f、r、f²)。
- 显著性水平(alpha, α):I 类错误的容忍上限,通常设为 .05。
- 统计功效(power, 1 − β):在效应真实存在时正确拒绝零假设的概率,社会科学通常要求 .80(Cohen, 1988)。
- 样本量(N):研究者最终要确定的目标值。
$\text{Power} = 1 - \beta = P(\text{reject } H_0 \mid H_1 \text{ true})$
2.2 效应量:从哪里来
功效分析能不能做好,核心在效应量的估计质量。三个来源(按优先级排序):
- 文献的 Meta 分析:同类研究的效应量汇总估计(如 Gignac & Szodorai, 2016 报告心理测量研究的中位 r = .20)。
- 同方向的先验研究:对象相似的已发表研究报告的效应量。
- Cohen(1988)惯例值:仅在找不到实质性依据时作为最后手段。
Cohen(1988)惯例效应量参考值:
| 检验类型 | 效应量指标 | 小 | 中 | 大 |
|---|---|---|---|---|
| 独立样本 t 检验 | Cohen's d | 0.20 | 0.50 | 0.80 |
| 单因素 ANOVA | Cohen's f | 0.10 | 0.25 | 0.40 |
| 多元线性回归 | Cohen's f² | 0.02 | 0.15 | 0.35 |
| 相关系数检验 | r | .10 | .30 | .50 |
| 卡方独立性检验 | Cohen's w | 0.10 | 0.30 | 0.50 |
警告:Cohen 自己在 1988 年的著作第 4 页明确写道,这些"惯例值仅供参照,不应替代基于实质文献的效应量估计"(Cohen, 1988, p. 4)。将惯例值当作唯一依据,审稿人有权质疑。
2.3 功效分析三种使用时机
- 前瞻性功效分析(a priori power analysis):研究开始前确定目标样本量——这是最规范的用法,也是方法章节必须报告的内容。
- 后验功效分析(post hoc power analysis):已有数据后计算功效——常被误用,不推荐单独引用,因为它是样本量和效应量的函数,只是重申了 p 值的信息(Hoenig & Heisey, 2001)。
- 敏感性功效分析(sensitivity power analysis):固定 N 和功效,反求最小可检测效应量(MDES)——用于评估已有数据集或历史数据能检验多大的效应。
三、各检验类型样本量计算:公式与示例
3.1 独立样本 t 检验
$n = \frac{2(z_{\alpha/2} + z_\beta)^2}{\delta^2}$
其中 $\delta = d$(Cohen's d),$z_{\alpha/2} = 1.96$(双侧 α = .05),$z_\beta = 0.84$(功效 = .80)。
示例:预期中效应量 d = 0.50,α = .05(双侧),功效 = .80。
$n = \frac{2(1.96 + 0.84)^2}{0.50^2} = \frac{2 \times 7.84}{0.25} \approx 63 \text{ 人/组}$
即每组约 63 人,总样本量约 126 人。经验法则"30人/组"仅能达到约 47% 的功效,远低于 .80 标准。
3.2 单因素 ANOVA
精确计算需查非中心 F 分布(无封闭式简化公式,下方示例值均由非中心 F 分布数值求解得到)。
示例:4 组,中效应量 f = 0.25,α = .05,功效 = .80 → 每组约 45 人,总 N = 180 人。
若用"每组 30 人",此设计的实际功效仅约 0.61(约 61%),距 .80 标准仍有显著差距——约 39% 的真实效应会被遗漏。
3.3 多元线性回归
Cohen(1988)给出了针对整体模型的近似公式:
$N = \frac{L}{f^2} + u + 1$
其中 L 是在给定 α、功效和预测变量数 u 下的非中心性参数查表值,u 为预测变量个数,f² 为效应量。
示例:5个预测变量,中效应量 f² = 0.15,α = .05,功效 = .80 → N ≈ 92 人。
Green(1991)的简化公式 N ≥ 50 + 8 × 5 = 90 人,在中效应量假设下恰好接近,这正是该法则唯一有效的边界条件。但若效应量为小(f² = .02),则需要约 395 人——"50 + 8m = 90"仅有约 20% 的功效,等同于无效研究。
3.4 相关系数检验
$n = \left(\frac{z_{\alpha/2} + z_\beta}{0.5 \ln\frac{1+r}{1-r}}\right)^2 + 3$
示例:预期 r = .30,α = .05,功效 = .80 → N ≈ 84 人。
若 r = .10(小效应),则需 N ≈ 782 人——用"30个样本"的功效不到 10%。
四、在 ChatSRS 一键完成功效分析
打开 chatsrs.com,上传数据或直接输入:
"我计划做独立样本 t 检验,预期效应量 d = 0.50,显著性水平 alpha = 0.05(双侧),目标功效 0.80,请计算每组需要多少样本量,并给出 APA 7th 格式的方法章节描述。"
ChatSRS 会调用 R 的 pwr 包精确求解,输出:样本量、检验功效曲线图、以及可直接粘贴进论文的 APA 方法段落。
如需回归分析的样本量,输入示例:
"多元线性回归,5个预测变量,预期中效应量 f-squared = 0.15,alpha = 0.05,目标功效 0.80,计算所需样本量,使用 Cohen(1988)方法,输出 APA 报告句式。"
五、APA 7th 方法章节:样本量报告模板
APA 7th(第三章)要求在方法章节明确报告样本量的确定依据,而非事后合理化。
独立样本 t 检验模板
样本量的确定基于前瞻性功效分析(a priori power analysis)。
参照 [文献/Meta分析来源],预期效应量为 d = [值]。
采用双侧检验(alpha = .05),目标统计功效为 .80(Cohen,1988),
使用 G*Power 3.1(Faul et al.,2007)计算得每组至少需要 [n] 名
参与者,总样本量不少于 [2n] 名。
填入数值的示例:
样本量的确定基于前瞻性功效分析。参照 Huang 等(2023)的元分析,该领域同类干预的平均效应量为 d = 0.52。采用双侧独立样本 t 检验(α = .05),目标统计功效为 .80(Cohen, 1988),使用 G*Power 3.1(Faul et al., 2007)计算得每组至少需要 59 名参与者,总样本量不少于 118 名。考虑约 10% 的数据损耗,实际招募目标为每组 65 名(总计 130 名)。
单因素 ANOVA 模板
基于前瞻性功效分析,参照 [文献],预期效应量为 Cohen's f = [值]。
采用单因素 ANOVA([k] 组),alpha = .05,目标功效 = .80,
计算得每组至少需要 [n] 名参与者(总 N = [kn])。
多元线性回归模板
基于前瞻性功效分析,参照 [文献],预期效应量为 f^2 = [值],
预测变量数为 [p]。采用 alpha = .05,目标功效 = .80,
按 Cohen(1988)方法计算,至少需要 [N] 名参与者。
注意事项
- 必须说明效应量来源:审稿人会追问"效应量 d = 0.50 从何而来",如果只写"参照 Cohen(1988)惯例值",高水平期刊通常会要求提供文献依据。
- 数据损耗补偿:实际招募量应在计算值基础上增加预期损耗比例(通常 10%–20%)。
- 不显著结果也要报告功效:若最终结果不显著,在讨论部分报告事后功效或最小可检测效应量,帮助读者判断是真无效应还是检验力不足。
六、经验法则 vs. 功效分析:对照总结
| 维度 | 经验法则(如 10倍/30个) | 功效分析 |
|---|---|---|
| 理论依据 | 无,口耳相传的简化 | 统计决策理论,Neyman-Pearson 框架 |
| 适用范围 | 仅在特定效应量假设下近似成立 | 适用任意效应量、设计、检验类型 |
| 输入要求 | 无需输入 | 需要效应量估计、α、目标功效 |
| 输出精度 | 粗糙,可能差出数倍 | 精确(给定效应量前提下) |
| 审稿人接受度 | 越来越低;顶刊几乎一律要求功效分析 | APA 7th 和 CONSORT/STROBE 的标准要求 |
| 风险 | 欠检验(浪费样本量、错误结论) | 取决于效应量估计质量 |
常见 FAQ
Q:中心极限定理保证了"30个样本就够了",这说法对吗?
A:不对。CLT 保证的是样本量趋向无穷大时样本均值的渐近正态性,而非"30个样本后就足够正态"。30 这个数字对正态分布或轻度偏态数据来说相对合理,但对高度偏态(如收入、反应时)、厚尾或离散分布,CLT 的收敛速度要慢得多,可能需要数百甚至上千个样本(Wilcox, 2012)。更重要的是,CLT 只处理抽样分布的近似正态性,与统计功效(你能否检测到真实效应)完全是两个问题。
Q:功效分析要求输入效应量,但研究开始前我根本不知道效应量,怎么办?
A:这是功效分析最常见的困惑。正确做法是按优先级尝试以下来源:(1) 同方向研究的 Meta 分析;(2) 该领域最高质量的 2–3 篇先验研究报告的效应量;(3) 领域专家的判断(如"我们认为实践意义最低的差异是 d = 0.30");(4) 作为最后手段,使用 Cohen 惯例值并在方法章节说明局限性。如果效应量不确定,可做敏感性分析:报告在不同效应量假设下(小/中/大)分别需要多少样本,以展示研究的稳健性。
Q:已经收集完数据才发现样本量不足,事后功效分析能"补救"吗?
A:不能用事后功效分析来合理化不足的样本量。Hoenig 和 Heisey(2001)的经典论文证明了:事后功效(observed power)与 p 值是一一对应的关系,它不提供独立信息——p > .05 时功效总是低,这只是对原本已知结果的循环解释。正确做法是在讨论部分报告"最小可检测效应量"(MDES):即在当前样本量和功效 .80 的条件下,研究能可靠检测到多大的效应,供读者判断研究的临床/实践意义。
Q:顶刊(如 Psychological Science)对样本量是否有硬性要求?
A:部分顶刊确实有最低要求或强烈建议。Psychological Science 的作者指南要求提交"功效分析或样本量确定的说明";Nature Human Behaviour 要求在方法章节明确报告功效分析;CONSORT(随机对照试验)和 STROBE(观察性研究)等报告规范也要求功效分析为必报项目。即便期刊无硬性要求,审稿人看到"每组 30 人依据中心极限定理"这类描述,几乎一定会要求补充功效分析说明。
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。