统计百科 ·

第一类与第二类错误是什么?α、β 与统计功效的论文解读

统计百科:系统解读 Type I 错误(α/假阳性)、Type II 错误(β/假阴性)与统计功效(1-β)的定义、相互权衡关系,给出 APA 7th 规范表述模板,帮助论文作者正确报告显著性水平与功效分析结果。

假设检验的核心不是"找到显著结果",而是在两种错误风险之间做出合理权衡。理解 Type I 错误(α)与 Type II 错误(β),以及统计功效(1-β)如何相互制约,是写出真正规范的统计方法章节的前提。


一、假设检验的四种结局

在任意一次假设检验中,现实与检验结论各有两种状态,组合产生四种结局:

H₀ 为真(无真实效应)H₀ 为假(存在真实效应)
检验结果:拒绝 H₀(显著)第一类错误(Type I) ← 假阳性正确拒绝(True Positive)
检验结果:保留 H₀(不显著)正确保留(True Negative)第二类错误(Type II) ← 假阴性

两种错误永远无法同时降为零——降低其中一种,另一种必然升高。这一根本矛盾决定了实验设计的一切权衡。


二、第一类错误(Type I Error)= α = 假阳性

定义

第一类错误:H₀ 实际为真,但检验错误地将其拒绝,即"发现了一个根本不存在的效应"。

发生概率等于显著性水平 α。

$P(\text{拒绝} H_0 \mid H_0 \text{为真}) = \alpha$

α 值的选择

领域常用 α 水平原因
社会科学、教育学、心理学.05Fisherian 传统,接受 1/20 误报率
临床医学(探索性研究).05初步筛查,后续验证
临床医学(确认性研究).01 或更严假阳性代价高(错误用药/手术)
基因组学(全基因组关联研究)5 × 10⁻⁸Bonferroni 校正数百万次检验
多重比较校正(Bonferroni)α / m(m = 检验次数)控制族错误率(FWER)

在论文中控制 Type I 错误

  • 预注册研究:提前声明 α 水平,防止事后调整
  • 多重比较校正:Bonferroni、Holm、FDR(Benjamini-Hochberg)
  • 报告精确 p 值:p = .032 而非"p < .05",让读者自行判断
  • 单尾 vs. 双尾:单尾检验 α 有效分配在一侧,但需理论支撑;双尾更保守,也更常用

三、第二类错误(Type II Error)= β = 假阴性

定义

第二类错误:H₀ 实际为假(真实效应存在),但检验未能拒绝 H₀,即"遗漏了一个真实存在的效应"。

发生概率记为 β。

$P(\text{保留} H_0 \mid H_0 \text{为假}) = \beta$

影响 β 的因素

因素变化方向对 β 的影响
样本量 N 增大N ↑β ↓(更容易检出效应)
效应量 d/η² 增大Effect ↑β ↓
显著性水平 α 收紧α ↓β ↑(Type I 与 Type II 的权衡)
测量误差(SD)增大SD ↑β ↑
单尾改双尾检验β 轻微增大

α 与 β 的权衡关系

在样本量固定时,α 与 β 反向联动

  • 把 α 从 .05 压到 .01 → β 从 .20 升到 .35(举例),功效从 .80 降到 .65
  • 唯一可以同时降低两者的方法:增大样本量增大效应量(如提高测量精度、选更敏感的操作)

这一权衡在研究设计阶段就应该明确,而非事后用"样本量不足"解释阴性结果。


四、统计功效(Statistical Power)= 1 − β

定义

统计功效(Power)是"当真实效应存在时,检验正确拒绝 H₀ 的概率":

$\text{Power} = 1 - \beta = P(\text{拒绝} H_0 \mid H_0 \text{为假})$

  • Power = .80 意味着:如果真实效应存在,重复 100 次实验,约 80 次能检出显著结果,约 20 次会遗漏(Type II 错误)
  • Cohen(1988)建议最低功效为 .80,高要求研究(如临床试验关键终点)应达到 .90 或 .95

功效四要素

功效由以下四个参数完全决定,任意三个确定后第四个也随之确定:

参数含义在功效分析中的角色
Power (1-β)目标功效水平通常设为 .80 或 .90
α显著性水平通常设为 .05
Effect size (d/f/w...)预期效应量来自文献 meta 分析或先导研究
N样本量研究设计中最可控的参数

先验功效分析(A priori power analysis):在数据收集前计算所需最小样本量 N,使检验以目标 Power(通常 .80)检出预设效应量。这是 APA 7th 和大多数期刊的方法章节要求。

事后功效分析(Post hoc power analysis):结果不显著后用实际 N 和效应量倒推功效。统计学界普遍不推荐,因为它本质上只是对 p 值的重新表述,不提供新信息(Hoenig & Heisey,2001)。


五、APA 7th 规范报告格式

方法章节:说明 α 水平

所有统计检验的显著性水平均设为 alpha = .05(双尾)。
采用 Bonferroni 方法对多重比较进行校正(m = 6),
校正后显著性阈值为 alpha = .008。

方法章节:报告先验功效分析

APA 7th 格式模板(使用 G*Power 或 ChatSRS)

根据 [文献] 报告的效应量(Cohen's d = 0.50,中等效应),
以 alpha = .05(双尾)、统计功效 = .80 为目标,
使用 G*Power 3.1 进行独立样本 t 检验的先验功效分析,
结果显示每组所需最小样本量为 N = 51(总 N = 102)。

填入数值的示例

根据 Smith 等(2023)的 meta 分析(Cohen's d = 0.45,95% CI [0.31, 0.59]),以 alpha = .05(双尾)、统计功效 = .80 为目标,使用 G*Power 3.1 进行独立样本 t 检验的先验功效分析(Two tails, t test),结果显示每组所需最小样本量为 N = 79(总 N = 158)。本研究最终招募 N = 174 名参与者(每组 87 人),功效提升至约 .86。

结果章节:解释阴性结果(TypeII 错误风险)

不显著结果的规范表述

两组间 [因变量] 差异未达显著水平,t(df) = X.XX, p = .XXX,
Cohen's d = .XX(95% CI [XX, XX]),为小效应。
考虑到当前样本量(N = XX)在 alpha = .05 下检验 d = .XX
中等效应的功效为 .XX,不排除存在小至中效应但本研究检验力
不足以检出的可能性(Type II 错误风险)。

讨论章节:局限性说明

本研究的局限之一是样本量偏小(N = XX),
在 alpha = .05 水平下检验中等效应(d = .50)的统计功效仅为 .XX,
存在遗漏真实效应的风险(Type II 错误)。
未来研究应在招募足够样本量后进行验证性重复。

六、常见场景的 Power/α/β 数值示例

以下数值均以独立样本 t 检验(双尾)、α = .05 为基准(数值引自 Cohen, 1988 原始表,与 G*Power 3.1 精确值及 base R power.t.test 可能存在 ±3% 差异):

效应量 d每组 N统计功效β(Type II 错误概率)
0.20(小)197.80.20
0.20(小)264.90.10
0.50(中)51.80.20
0.50(中)68.90.10
0.80(大)21.80.20
0.80(大)28.90.10

若改为单侧检验,N 约可减少 20%;若 α 收紧为 .01,N 需增加约 40%。


七、在 ChatSRS 一句话完成功效分析与报告

打开 chatsrs.com,上传数据后输入:

请根据文献中报告的 Cohen's d = 0.50 进行独立样本 t 检验的先验功效分析,目标功效 = 0.80,alpha = .05(双尾);输出所需最小每组样本量,并生成符合 APA 7th 格式的功效分析报告段落,注明 Type I 错误率(alpha)、目标 Type II 错误率(beta = .20)和统计功效(1-beta = .80)。

ChatSRS 会调用 base R 的 power.t.test 函数计算结果(采用精确非中心 t 分布,与 Cohen, 1988 原始表值存在约 ±3% 差异),并自动生成可直接粘贴进方法章节的 APA 7th 格式段落。

如需为已完成研究补写功效说明(不显著结果的局限性),输入:

我的独立样本 t 检验结果:t(118) = 1.42, p = .158, Cohen's d = 0.26,每组 N = 60。请分析该研究的事后功效,并按 APA 7th 格式撰写结果章节的局限性说明,解释 Type II 错误风险。


八、Type I 与 Type II 错误的研究设计权衡清单

在设计研究时,可用以下清单确认错误控制策略:

  • 已确定理论预期效应量来源(文献 meta 分析 / 先导研究 / 理论最小效应)
  • 已完成先验功效分析,目标 Power >= .80
  • 显著性水平 α 已预先注册(避免 p-hacking)
  • 若进行多重比较,已选定校正方法(Bonferroni / Holm / FDR)
  • 方法章节已说明 α 水平及其设定依据
  • 无论结果是否显著,均报告效应量及置信区间
  • 阴性结果章节已说明功效与 Type II 错误风险

FAQ

Q:α = .05 是"95% 置信度"的意思吗?

A:不完全是。α = .05 是"如果 H₀ 为真,出现当前或更极端数据的概率不超过 5% 时拒绝 H₀",即控制 Type I 错误率在 5% 以内。95% 置信区间是其"对偶"概念,但两者语义不同:p < .05 的结论是关于当前检验的拒绝决策,95% CI 是对总体参数范围的区间估计。两者在正态近似条件下等价,但应分别解读,不能混用措辞。

Q:结果不显著,就能说"第一类错误被很好地控制了"吗?

A:不能。α 是对无数次重复实验的长期错误率控制,不是对单次实验的保证。某次检验 p = .08 不显著,不代表 H₀ 一定为真;它只是"数据不足以拒绝 H₀"。要对 H₀ 做出"支持"性推断,需要等价性检验(Equivalence Test,TOST 方法)或贝叶斯方法(计算支持 H₀ 的 Bayes Factor)。

Q:事后功效分析为什么不推荐?

A:事后功效分析使用实际观测到的效应量(observed d)和实际 N 倒推功效,其结果与 p 值完全对应:p < .05 时 Power 必然 > .50,p > .05 时 Power 必然 < .50。因此它不提供任何 p 值之外的新信息,反而容易误导读者(Hoenig & Heisey,2001)。正确做法是:报告效应量置信区间,并说明"以该 CI 上限为目标效应量时,当前 N 的功效为 XX"——这才是真正有信息量的功效陈述。

Q:β = .20、Power = .80 是强制要求吗?

A:不是强制,但 .80 是 Cohen(1988)提出的"可接受下限",已被大多数期刊和基金委员会默认采纳。对于高风险决策(如关键临床试验),通常要求 .90 甚至 .95。对于探索性研究,.80 是合理起点。重要的是:功效水平应在研究设计时明确声明,并与效应量假设一起列入方法章节,而不是事后补写。

Q:增大样本量一定能同时降低 Type I 和 Type II 错误吗?

A:不一定同时降低两者。增大样本量会降低 β(提高功效),但对 α 没有影响——α 由研究者设定,不受 N 影响。然而,N 足够大时,几乎任何微小效应都会在 α = .05 下显著,此时统计显著性失去实际意义。因此大样本研究更应该关注效应量和实践意义,而非单纯追求显著性。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。