统计百科 ·

样本量经验法则(10倍/30个)靠谱吗?功效分析才是科学答案

统计百科:破除"每个预测变量10个样本""至少30个"等经验法则的迷思,系统讲解功效分析(power analysis)如何科学确定样本量,给出可抄进论文的APA报告句式,落点ChatSRS一键计算。

每个预测变量至少 10 个样本?总样本量至少 30 个?这类经验法则流传极广,却没有坚实的统计学依据。用错了要么白白浪费资源,要么样本量严重不足导致论文被拒。本文从统计功效(statistical power)出发,系统讲解功效分析如何科学确定样本量,并给出可直接套用的 APA 7th 报告模板。


一、经验法则从哪里来,为什么它不可靠

1.1 最常见的三条经验法则

在研究生课堂和论文写作指南里,下面几条话几乎人尽皆知:

  • "每个预测变量至少 10 个样本"(10:1 rule):用于多元回归,流传最广。
  • "至少 30 个总样本":声称由中心极限定理保证正态性。
  • "每组至少 30 人":用于 t 检验或 ANOVA 的各组要求。

1.2 这些法则的真实来源

Green(1991)提出了回归样本量的两条启发式规则:N ≥ 50 + 8m(检验整体模型)和 N ≥ 104 + m(检验单个预测变量,m 为预测变量数量)。这两条规则本身就假定了中等效应量( ≈ .15)和 80% 功效。被口耳相传之后,"104 + m"被简化成了"10倍",效应量和功效的前提条件彻底消失了。

"30个样本"的说法则更为模糊,与中心极限定理(CLT)的关系被严重夸大。CLT 保证的是随样本量增大均值的渐近正态性,而非"30个样本就够了"——这一数字在高度偏态分布或小效应量时根本不成立(Wilcox, 2012)。

1.3 经验法则失效的典型场景

场景用经验法则实际需要后果
小效应量回归( = .02),5个预测变量~50 人~395 人(80% 功效)严重欠检验,I 类错误虚高
大效应量 t 检验(d = 1.2),两组30人/组12人/组(80% 功效)资源浪费
中效应量 ANOVA(f = .25),4 组30人/组45人/组(80% 功效)漏检真实效应
相关系数检验(r = .10)30 人782 人(80% 功效)样本量差出25倍以上

二、功效分析的核心逻辑

2.1 四个相互制约的参数

功效分析(power analysis)描述的是以下四个参数之间的关系,确定其中三个,第四个随之确定:

  • 效应量(effect size):总体中真实差异或关联的大小(如 Cohen's dfr)。
  • 显著性水平(alpha, α:I 类错误的容忍上限,通常设为 .05。
  • 统计功效(power, 1 − β:在效应真实存在时正确拒绝零假设的概率,社会科学通常要求 .80(Cohen, 1988)。
  • 样本量(N:研究者最终要确定的目标值。

$\text{Power} = 1 - \beta = P(\text{reject } H_0 \mid H_1 \text{ true})$

2.2 效应量:从哪里来

功效分析能不能做好,核心在效应量的估计质量。三个来源(按优先级排序):

  1. 文献的 Meta 分析:同类研究的效应量汇总估计(如 Gignac & Szodorai, 2016 报告心理测量研究的中位 r = .20)。
  2. 同方向的先验研究:对象相似的已发表研究报告的效应量。
  3. Cohen(1988)惯例值:仅在找不到实质性依据时作为最后手段。

Cohen(1988)惯例效应量参考值

检验类型效应量指标
独立样本 t 检验Cohen's d0.200.500.80
单因素 ANOVACohen's f0.100.250.40
多元线性回归Cohen's 0.020.150.35
相关系数检验r.10.30.50
卡方独立性检验Cohen's w0.100.300.50

警告:Cohen 自己在 1988 年的著作第 4 页明确写道,这些"惯例值仅供参照,不应替代基于实质文献的效应量估计"(Cohen, 1988, p. 4)。将惯例值当作唯一依据,审稿人有权质疑。

2.3 功效分析三种使用时机

  • 前瞻性功效分析(a priori power analysis):研究开始前确定目标样本量——这是最规范的用法,也是方法章节必须报告的内容。
  • 后验功效分析(post hoc power analysis):已有数据后计算功效——常被误用,不推荐单独引用,因为它是样本量和效应量的函数,只是重申了 p 值的信息(Hoenig & Heisey, 2001)。
  • 敏感性功效分析(sensitivity power analysis):固定 N 和功效,反求最小可检测效应量(MDES)——用于评估已有数据集或历史数据能检验多大的效应。

三、各检验类型样本量计算:公式与示例

3.1 独立样本 t 检验

$n = \frac{2(z_{\alpha/2} + z_\beta)^2}{\delta^2}$

其中 $\delta = d$(Cohen's d),$z_{\alpha/2} = 1.96$(双侧 α = .05),$z_\beta = 0.84$(功效 = .80)。

示例:预期中效应量 d = 0.50,α = .05(双侧),功效 = .80。

$n = \frac{2(1.96 + 0.84)^2}{0.50^2} = \frac{2 \times 7.84}{0.25} \approx 63 \text{ 人/组}$

即每组约 63 人,总样本量约 126 人。经验法则"30人/组"仅能达到约 47% 的功效,远低于 .80 标准。

3.2 单因素 ANOVA

精确计算需查非中心 F 分布(无封闭式简化公式,下方示例值均由非中心 F 分布数值求解得到)。

示例:4 组,中效应量 f = 0.25,α = .05,功效 = .80 → 每组约 45 人,总 N = 180 人。

若用"每组 30 人",此设计的实际功效仅约 0.61(约 61%),距 .80 标准仍有显著差距——约 39% 的真实效应会被遗漏。

3.3 多元线性回归

Cohen(1988)给出了针对整体模型的近似公式:

$N = \frac{L}{f^2} + u + 1$

其中 L 是在给定 α、功效和预测变量数 u 下的非中心性参数查表值,u 为预测变量个数, 为效应量。

示例:5个预测变量,中效应量 = 0.15,α = .05,功效 = .80 → N ≈ 92 人。

Green(1991)的简化公式 N ≥ 50 + 8 × 5 = 90 人,在中效应量假设下恰好接近,这正是该法则唯一有效的边界条件。但若效应量为小( = .02),则需要约 395 人——"50 + 8m = 90"仅有约 20% 的功效,等同于无效研究。

3.4 相关系数检验

$n = \left(\frac{z_{\alpha/2} + z_\beta}{0.5 \ln\frac{1+r}{1-r}}\right)^2 + 3$

示例:预期 r = .30,α = .05,功效 = .80 → N ≈ 84 人。
r = .10(小效应),则需 N ≈ 782 人——用"30个样本"的功效不到 10%。


四、在 ChatSRS 一键完成功效分析

打开 chatsrs.com,上传数据或直接输入:

"我计划做独立样本 t 检验,预期效应量 d = 0.50,显著性水平 alpha = 0.05(双侧),目标功效 0.80,请计算每组需要多少样本量,并给出 APA 7th 格式的方法章节描述。"

ChatSRS 会调用 R 的 pwr 包精确求解,输出:样本量、检验功效曲线图、以及可直接粘贴进论文的 APA 方法段落。

如需回归分析的样本量,输入示例:

"多元线性回归,5个预测变量,预期中效应量 f-squared = 0.15,alpha = 0.05,目标功效 0.80,计算所需样本量,使用 Cohen(1988)方法,输出 APA 报告句式。"


五、APA 7th 方法章节:样本量报告模板

APA 7th(第三章)要求在方法章节明确报告样本量的确定依据,而非事后合理化。

独立样本 t 检验模板

样本量的确定基于前瞻性功效分析(a priori power analysis)。
参照 [文献/Meta分析来源],预期效应量为 d = [值]。
采用双侧检验(alpha = .05),目标统计功效为 .80(Cohen,1988),
使用 G*Power 3.1(Faul et al.,2007)计算得每组至少需要 [n] 名
参与者,总样本量不少于 [2n] 名。

填入数值的示例

样本量的确定基于前瞻性功效分析。参照 Huang 等(2023)的元分析,该领域同类干预的平均效应量为 d = 0.52。采用双侧独立样本 t 检验(α = .05),目标统计功效为 .80(Cohen, 1988),使用 G*Power 3.1(Faul et al., 2007)计算得每组至少需要 59 名参与者,总样本量不少于 118 名。考虑约 10% 的数据损耗,实际招募目标为每组 65 名(总计 130 名)。

单因素 ANOVA 模板

基于前瞻性功效分析,参照 [文献],预期效应量为 Cohen's f = [值]。
采用单因素 ANOVA([k] 组),alpha = .05,目标功效 = .80,
计算得每组至少需要 [n] 名参与者(总 N = [kn])。

多元线性回归模板

基于前瞻性功效分析,参照 [文献],预期效应量为 f^2 = [值],
预测变量数为 [p]。采用 alpha = .05,目标功效 = .80,
按 Cohen(1988)方法计算,至少需要 [N] 名参与者。

注意事项

  • 必须说明效应量来源:审稿人会追问"效应量 d = 0.50 从何而来",如果只写"参照 Cohen(1988)惯例值",高水平期刊通常会要求提供文献依据。
  • 数据损耗补偿:实际招募量应在计算值基础上增加预期损耗比例(通常 10%–20%)。
  • 不显著结果也要报告功效:若最终结果不显著,在讨论部分报告事后功效或最小可检测效应量,帮助读者判断是真无效应还是检验力不足。

六、经验法则 vs. 功效分析:对照总结

维度经验法则(如 10倍/30个)功效分析
理论依据无,口耳相传的简化统计决策理论,Neyman-Pearson 框架
适用范围仅在特定效应量假设下近似成立适用任意效应量、设计、检验类型
输入要求无需输入需要效应量估计、α、目标功效
输出精度粗糙,可能差出数倍精确(给定效应量前提下)
审稿人接受度越来越低;顶刊几乎一律要求功效分析APA 7th 和 CONSORT/STROBE 的标准要求
风险欠检验(浪费样本量、错误结论)取决于效应量估计质量

常见 FAQ

Q:中心极限定理保证了"30个样本就够了",这说法对吗?

A:不对。CLT 保证的是样本量趋向无穷大时样本均值的渐近正态性,而非"30个样本后就足够正态"。30 这个数字对正态分布或轻度偏态数据来说相对合理,但对高度偏态(如收入、反应时)、厚尾或离散分布,CLT 的收敛速度要慢得多,可能需要数百甚至上千个样本(Wilcox, 2012)。更重要的是,CLT 只处理抽样分布的近似正态性,与统计功效(你能否检测到真实效应)完全是两个问题。

Q:功效分析要求输入效应量,但研究开始前我根本不知道效应量,怎么办?

A:这是功效分析最常见的困惑。正确做法是按优先级尝试以下来源:(1) 同方向研究的 Meta 分析;(2) 该领域最高质量的 2–3 篇先验研究报告的效应量;(3) 领域专家的判断(如"我们认为实践意义最低的差异是 d = 0.30");(4) 作为最后手段,使用 Cohen 惯例值并在方法章节说明局限性。如果效应量不确定,可做敏感性分析:报告在不同效应量假设下(小/中/大)分别需要多少样本,以展示研究的稳健性。

Q:已经收集完数据才发现样本量不足,事后功效分析能"补救"吗?

A:不能用事后功效分析来合理化不足的样本量。Hoenig 和 Heisey(2001)的经典论文证明了:事后功效(observed power)与 p 值是一一对应的关系,它不提供独立信息——p > .05 时功效总是低,这只是对原本已知结果的循环解释。正确做法是在讨论部分报告"最小可检测效应量"(MDES):即在当前样本量和功效 .80 的条件下,研究能可靠检测到多大的效应,供读者判断研究的临床/实践意义。

Q:顶刊(如 Psychological Science)对样本量是否有硬性要求?

A:部分顶刊确实有最低要求或强烈建议。Psychological Science 的作者指南要求提交"功效分析或样本量确定的说明";Nature Human Behaviour 要求在方法章节明确报告功效分析;CONSORT(随机对照试验)和 STROBE(观察性研究)等报告规范也要求功效分析为必报项目。即便期刊无硬性要求,审稿人看到"每组 30 人依据中心极限定理"这类描述,几乎一定会要求补充功效分析说明。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。