统计百科 ·
第一类与第二类错误是什么?α、β 与统计功效的论文解读
统计百科:系统解读 Type I 错误(α/假阳性)、Type II 错误(β/假阴性)与统计功效(1-β)的定义、相互权衡关系,给出 APA 7th 规范表述模板,帮助论文作者正确报告显著性水平与功效分析结果。
假设检验的核心不是"找到显著结果",而是在两种错误风险之间做出合理权衡。理解 Type I 错误(α)与 Type II 错误(β),以及统计功效(1-β)如何相互制约,是写出真正规范的统计方法章节的前提。
一、假设检验的四种结局
在任意一次假设检验中,现实与检验结论各有两种状态,组合产生四种结局:
| H₀ 为真(无真实效应) | H₀ 为假(存在真实效应) | |
|---|---|---|
| 检验结果:拒绝 H₀(显著) | 第一类错误(Type I) ← 假阳性 | 正确拒绝(True Positive) |
| 检验结果:保留 H₀(不显著) | 正确保留(True Negative) | 第二类错误(Type II) ← 假阴性 |
两种错误永远无法同时降为零——降低其中一种,另一种必然升高。这一根本矛盾决定了实验设计的一切权衡。
二、第一类错误(Type I Error)= α = 假阳性
定义
第一类错误:H₀ 实际为真,但检验错误地将其拒绝,即"发现了一个根本不存在的效应"。
发生概率等于显著性水平 α。
$P(\text{拒绝} H_0 \mid H_0 \text{为真}) = \alpha$
α 值的选择
| 领域 | 常用 α 水平 | 原因 |
|---|---|---|
| 社会科学、教育学、心理学 | .05 | Fisherian 传统,接受 1/20 误报率 |
| 临床医学(探索性研究) | .05 | 初步筛查,后续验证 |
| 临床医学(确认性研究) | .01 或更严 | 假阳性代价高(错误用药/手术) |
| 基因组学(全基因组关联研究) | 5 × 10⁻⁸ | Bonferroni 校正数百万次检验 |
| 多重比较校正(Bonferroni) | α / m(m = 检验次数) | 控制族错误率(FWER) |
在论文中控制 Type I 错误
- 预注册研究:提前声明 α 水平,防止事后调整
- 多重比较校正:Bonferroni、Holm、FDR(Benjamini-Hochberg)
- 报告精确 p 值:p = .032 而非"p < .05",让读者自行判断
- 单尾 vs. 双尾:单尾检验 α 有效分配在一侧,但需理论支撑;双尾更保守,也更常用
三、第二类错误(Type II Error)= β = 假阴性
定义
第二类错误:H₀ 实际为假(真实效应存在),但检验未能拒绝 H₀,即"遗漏了一个真实存在的效应"。
发生概率记为 β。
$P(\text{保留} H_0 \mid H_0 \text{为假}) = \beta$
影响 β 的因素
| 因素 | 变化方向 | 对 β 的影响 |
|---|---|---|
| 样本量 N 增大 | N ↑ | β ↓(更容易检出效应) |
| 效应量 d/η² 增大 | Effect ↑ | β ↓ |
| 显著性水平 α 收紧 | α ↓ | β ↑(Type I 与 Type II 的权衡) |
| 测量误差(SD)增大 | SD ↑ | β ↑ |
| 单尾改双尾检验 | — | β 轻微增大 |
α 与 β 的权衡关系
在样本量固定时,α 与 β 反向联动:
- 把 α 从 .05 压到 .01 → β 从 .20 升到 .35(举例),功效从 .80 降到 .65
- 唯一可以同时降低两者的方法:增大样本量或增大效应量(如提高测量精度、选更敏感的操作)
这一权衡在研究设计阶段就应该明确,而非事后用"样本量不足"解释阴性结果。
四、统计功效(Statistical Power)= 1 − β
定义
统计功效(Power)是"当真实效应存在时,检验正确拒绝 H₀ 的概率":
$\text{Power} = 1 - \beta = P(\text{拒绝} H_0 \mid H_0 \text{为假})$
- Power = .80 意味着:如果真实效应存在,重复 100 次实验,约 80 次能检出显著结果,约 20 次会遗漏(Type II 错误)
- Cohen(1988)建议最低功效为 .80,高要求研究(如临床试验关键终点)应达到 .90 或 .95
功效四要素
功效由以下四个参数完全决定,任意三个确定后第四个也随之确定:
| 参数 | 含义 | 在功效分析中的角色 |
|---|---|---|
| Power (1-β) | 目标功效水平 | 通常设为 .80 或 .90 |
| α | 显著性水平 | 通常设为 .05 |
| Effect size (d/f/w...) | 预期效应量 | 来自文献 meta 分析或先导研究 |
| N | 样本量 | 研究设计中最可控的参数 |
先验功效分析(A priori power analysis):在数据收集前计算所需最小样本量 N,使检验以目标 Power(通常 .80)检出预设效应量。这是 APA 7th 和大多数期刊的方法章节要求。
事后功效分析(Post hoc power analysis):结果不显著后用实际 N 和效应量倒推功效。统计学界普遍不推荐,因为它本质上只是对 p 值的重新表述,不提供新信息(Hoenig & Heisey,2001)。
五、APA 7th 规范报告格式
方法章节:说明 α 水平
所有统计检验的显著性水平均设为 alpha = .05(双尾)。
采用 Bonferroni 方法对多重比较进行校正(m = 6),
校正后显著性阈值为 alpha = .008。
方法章节:报告先验功效分析
APA 7th 格式模板(使用 G*Power 或 ChatSRS):
根据 [文献] 报告的效应量(Cohen's d = 0.50,中等效应),
以 alpha = .05(双尾)、统计功效 = .80 为目标,
使用 G*Power 3.1 进行独立样本 t 检验的先验功效分析,
结果显示每组所需最小样本量为 N = 51(总 N = 102)。
填入数值的示例:
根据 Smith 等(2023)的 meta 分析(Cohen's d = 0.45,95% CI [0.31, 0.59]),以 alpha = .05(双尾)、统计功效 = .80 为目标,使用 G*Power 3.1 进行独立样本 t 检验的先验功效分析(Two tails, t test),结果显示每组所需最小样本量为 N = 79(总 N = 158)。本研究最终招募 N = 174 名参与者(每组 87 人),功效提升至约 .86。
结果章节:解释阴性结果(TypeII 错误风险)
不显著结果的规范表述:
两组间 [因变量] 差异未达显著水平,t(df) = X.XX, p = .XXX,
Cohen's d = .XX(95% CI [XX, XX]),为小效应。
考虑到当前样本量(N = XX)在 alpha = .05 下检验 d = .XX
中等效应的功效为 .XX,不排除存在小至中效应但本研究检验力
不足以检出的可能性(Type II 错误风险)。
讨论章节:局限性说明
本研究的局限之一是样本量偏小(N = XX),
在 alpha = .05 水平下检验中等效应(d = .50)的统计功效仅为 .XX,
存在遗漏真实效应的风险(Type II 错误)。
未来研究应在招募足够样本量后进行验证性重复。
六、常见场景的 Power/α/β 数值示例
以下数值均以独立样本 t 检验(双尾)、α = .05 为基准(数值引自 Cohen, 1988 原始表,与 G*Power 3.1 精确值及 base R power.t.test 可能存在 ±3% 差异):
| 效应量 d | 每组 N | 统计功效 | β(Type II 错误概率) |
|---|---|---|---|
| 0.20(小) | 197 | .80 | .20 |
| 0.20(小) | 264 | .90 | .10 |
| 0.50(中) | 51 | .80 | .20 |
| 0.50(中) | 68 | .90 | .10 |
| 0.80(大) | 21 | .80 | .20 |
| 0.80(大) | 28 | .90 | .10 |
若改为单侧检验,N 约可减少 20%;若 α 收紧为 .01,N 需增加约 40%。
七、在 ChatSRS 一句话完成功效分析与报告
打开 chatsrs.com,上传数据后输入:
请根据文献中报告的 Cohen's d = 0.50 进行独立样本 t 检验的先验功效分析,目标功效 = 0.80,alpha = .05(双尾);输出所需最小每组样本量,并生成符合 APA 7th 格式的功效分析报告段落,注明 Type I 错误率(alpha)、目标 Type II 错误率(beta = .20)和统计功效(1-beta = .80)。
ChatSRS 会调用 base R 的 power.t.test 函数计算结果(采用精确非中心 t 分布,与 Cohen, 1988 原始表值存在约 ±3% 差异),并自动生成可直接粘贴进方法章节的 APA 7th 格式段落。
如需为已完成研究补写功效说明(不显著结果的局限性),输入:
我的独立样本 t 检验结果:t(118) = 1.42, p = .158, Cohen's d = 0.26,每组 N = 60。请分析该研究的事后功效,并按 APA 7th 格式撰写结果章节的局限性说明,解释 Type II 错误风险。
八、Type I 与 Type II 错误的研究设计权衡清单
在设计研究时,可用以下清单确认错误控制策略:
- 已确定理论预期效应量来源(文献 meta 分析 / 先导研究 / 理论最小效应)
- 已完成先验功效分析,目标 Power >= .80
- 显著性水平 α 已预先注册(避免 p-hacking)
- 若进行多重比较,已选定校正方法(Bonferroni / Holm / FDR)
- 方法章节已说明 α 水平及其设定依据
- 无论结果是否显著,均报告效应量及置信区间
- 阴性结果章节已说明功效与 Type II 错误风险
FAQ
Q:α = .05 是"95% 置信度"的意思吗?
A:不完全是。α = .05 是"如果 H₀ 为真,出现当前或更极端数据的概率不超过 5% 时拒绝 H₀",即控制 Type I 错误率在 5% 以内。95% 置信区间是其"对偶"概念,但两者语义不同:p < .05 的结论是关于当前检验的拒绝决策,95% CI 是对总体参数范围的区间估计。两者在正态近似条件下等价,但应分别解读,不能混用措辞。
Q:结果不显著,就能说"第一类错误被很好地控制了"吗?
A:不能。α 是对无数次重复实验的长期错误率控制,不是对单次实验的保证。某次检验 p = .08 不显著,不代表 H₀ 一定为真;它只是"数据不足以拒绝 H₀"。要对 H₀ 做出"支持"性推断,需要等价性检验(Equivalence Test,TOST 方法)或贝叶斯方法(计算支持 H₀ 的 Bayes Factor)。
Q:事后功效分析为什么不推荐?
A:事后功效分析使用实际观测到的效应量(observed d)和实际 N 倒推功效,其结果与 p 值完全对应:p < .05 时 Power 必然 > .50,p > .05 时 Power 必然 < .50。因此它不提供任何 p 值之外的新信息,反而容易误导读者(Hoenig & Heisey,2001)。正确做法是:报告效应量置信区间,并说明"以该 CI 上限为目标效应量时,当前 N 的功效为 XX"——这才是真正有信息量的功效陈述。
Q:β = .20、Power = .80 是强制要求吗?
A:不是强制,但 .80 是 Cohen(1988)提出的"可接受下限",已被大多数期刊和基金委员会默认采纳。对于高风险决策(如关键临床试验),通常要求 .90 甚至 .95。对于探索性研究,.80 是合理起点。重要的是:功效水平应在研究设计时明确声明,并与效应量假设一起列入方法章节,而不是事后补写。
Q:增大样本量一定能同时降低 Type I 和 Type II 错误吗?
A:不一定同时降低两者。增大样本量会降低 β(提高功效),但对 α 没有影响——α 由研究者设定,不受 N 影响。然而,N 足够大时,几乎任何微小效应都会在 α = .05 下显著,此时统计显著性失去实际意义。因此大样本研究更应该关注效应量和实践意义,而非单纯追求显著性。
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。