统计百科 ·

效应量的 APA 7th 报告 — 为什么必报、Cohen's d/η²/ω²/r/Cramér's V/OR 用法全解

统计百科:效应量 APA 7th 完整指南——为什么必须报告效应量、Cohen's d/η²/偏η²/ω²/r/Cramér's V/OR 各自适用场景与 Cohen(1988) 阈值、报告模板,消灭论文中最常见的效应量缺漏错误。

审稿人批回来的修改意见里有一条几乎必出现:"请补充效应量"。但效应量有好几种,什么分析用哪种?Cohen's d 和 eta 平方有什么区别?ω² 什么时候替代 η²?r 在哪里出现?这篇文章系统地讲清楚每种效应量的计算逻辑、适用场景、Cohen(1988)阈值,给出可直接套用的 APA 7th 报告模板。


为什么效应量是"必报"指标

p 值告诉你"有没有",效应量告诉你"有多大"

统计显著(p < .05)只说明"我们有足够的证据拒绝零假设",它受样本量严重影响:

  • 样本量 N = 10,000 时,两组均值差 0.01 分也可能 p < .001(统计显著但毫无实践意义)
  • 样本量 N = 20 时,两组均值差 0.5 SD 可能 p = .12(不显著但效应中等)

效应量(Effect Size) 是不依赖样本量的标准化差异度量,回答的问题是:"这个差异/关联在实际意义上有多大?"

APA 7th 明确要求报告效应量

APA Publication Manual 第七版(2020)第 6.24 节明确规定:

"For each inferential statistic reported, provide an effect size."(对每一个推断统计,均需报告效应量。)

这不是建议,是规定。目前国际期刊(Psychological Science、Nature Human Behaviour、JAMA 等)均要求效应量,中文社科期刊也在快速跟进。

效应量的另一个作用:功效分析与样本量计算

在研究设计阶段,你需要预估效应量大小来计算所需样本量(通过 G*Power 等工具)。发表的文献中如果报告了效应量,读者就可以用其做功效分析,判断复验研究需要多少样本——这正是效应量报告的科学累积价值。


一、效应量总览:按分析类型速查

分析类型推荐效应量备选
独立/配对/单样本 t 检验Cohen's dGlass's delta(异方差时)
单因素 ANOVAη²(eta 平方)或 ω²
双因素及以上 ANOVA / ANCOVA偏 η²(partial eta 平方)偏 ω²
重复测量 ANOVA偏 η²偏 ω²
皮尔逊相关/简单回归r(Pearson r)
多元回归R²、adjusted R²、f²(Cohen's f²)
卡方检验(独立性检验)Cramér's Vφ(phi,仅 2×2 表)
Logistic 回归OR(优势比)Nagelkerke R²
非参数检验(Mann-Whitney U)r = Z / √Nrank-biserial correlation
元分析d 或 g(Hedges' g)

下面逐一讲清楚每种效应量的含义、阈值和报告格式。


二、Cohen's d — t 检验的效应量

定义与计算

Cohen's d 衡量两组均值差相对于共同标准差的大小:

d = (M1 - M2) / SD_pooled

其中 SD_pooled(合并标准差)= sqrt[((n1-1)*SD1² + (n2-1)*SD2²) / (n1+n2-2)]

对于配对样本 t 检验,d_z = M_diff / SD_diff(差值均分除以差值标准差)。

Cohen(1988)效应大小阈值

效应大小Cohen's d 值
小效应0.20
中效应0.50
大效应0.80

注意:d = 0.20 是"小效应"的参考点,不是"可忽略"——在医学、教育政策等领域,d = 0.20 可能有重要实践价值。Cohen(1988)的阈值是领域无关的统计惯例,需要结合学科背景判断实际意义。

APA 报告格式

独立样本 t 检验:
t([df]) = X.XX, p [值], 95% CI [XX, XX], Cohen's d = X.XX([小/中/大]效应)

配对样本 t 检验:
t([df]) = X.XX, p [值], 均值差 = X.XX(95% CI [XX, XX]),Cohen's d_z = X.XX

完整报告示例

独立样本 t 检验结果显示,实验组干预后焦虑得分(M = 5.82,SD = 3.14)显著低于对照组(M = 8.47,SD = 3.52),t(118) = -4.45,p < .001,95% CI [-3.83, -1.47],Cohen's d = 0.81,为大效应(Cohen,1988)。

Hedges' g:小样本校正版本

当每组 n < 20 时,Cohen's d 倾向于高估总体效应量。Hedges' g 是 d 的小样本无偏校正版本,常用于元分析:

g = d × (1 - 3 / (4*(n1+n2) - 9))

样本量较小时,优先报告 g;元分析标准报告也推荐 g。


三、η²(eta 平方)与偏 η²(partial eta 平方)— ANOVA 的效应量

eta 平方(η²)

η² = SS_between / SS_total

含义:自变量解释的方差占总方差的比例。

适用:仅适用于单因素 ANOVA(此时 η² = 偏 η²)。

偏 eta 平方(partial η²)

partial η² = SS_effect / (SS_effect + SS_error)

含义在控制其他因素后,该因素解释的方差占"该因素 + 误差"的比例。分母不含其他因素的 SS,反映该因素的独立贡献。

适用:双因素及以上 ANOVA、ANCOVA、重复测量 ANOVA、混合设计 ANOVA。SPSS 默认输出偏 η²,但若方法章节不说明,读者无法区分是 η² 还是 partial η²,必须在方法章节注明"效应量报告偏 eta 平方(partial η²)"

Cohen(1988)效应大小阈值

无论 η² 还是 partial η²,Cohen(1988)的判断标准相同:

效应大小η² / partial η²
小效应.01
中效应.06
大效应.14

APA 报告格式

单因素 ANOVA:
F([df1], [df2]) = X.XX, p [值], η² = .XX([小/中/大]效应)

双因素 ANOVA(每个效应分别报告):
主效应 A:F([df1], [df2]) = X.XX, p [值], partial η² = .XX
主效应 B:F([df1], [df2]) = X.XX, p [值], partial η² = .XX
交互 A×B:F([df1], [df2]) = X.XX, p [值], partial η² = .XX

完整报告示例(双因素 ANOVA)

双因素方差分析结果显示,性别主效应显著,F(1, 196) = 8.42,p = .004,partial η² = .041,为小效应;教学方法主效应显著,F(3, 196) = 24.61,p < .001,partial η² = .274,为大效应;交互效应显著,F(3, 196) = 3.85,p = .010,partial η² = .056,为中等效应(Cohen,1988)。


四、ω²(omega 平方)— eta 平方的无偏替代

为什么 eta 平方会高估效应

η² 是基于当前样本数据的效应量,由于分子(SS_between)包含了抽样误差,η² 倾向于高估总体效应量,尤其在小样本时偏差更大。

omega 平方的计算

ω² = (SS_between - (k-1) * MS_within) / (SS_total + MS_within)

ω² 通过从分子中减去期望的抽样误差来校正高估偏差,是总体效应量 η² 的无偏估计

ω² 与 η² 的数值关系

  • ω² 通常略小于 η²
  • 样本量越小,两者差异越大;N >= 200 时两者接近
  • ω² 不会像 η² 那样在小样本中出现虚假地偏大

选用原则

场景推荐
N >= 100,目标是简洁报告η² 或 partial η²(被广泛接受)
N < 100,或需要向总体推广ω² 或 partial ω²(更保守,更准确)
心理学顶刊(Psychological Science 等)ω² 越来越普遍
同时报告两者最安全的选择,审稿人不会挑剔
方法章节必须说明"效应量报告 ω²(omega 平方),参照 Cohen(1988)阈值"

Cohen(1988)阈值:ω² 与 η² 使用相同的阈值(小 .01 / 中 .06 / 大 .14),因为两者在大样本时几乎相等。


五、r(Pearson r)— 相关与回归的效应量

r 作为效应量的两种用途

用途 1:Pearson 相关本身的效应量

在相关分析中,r 本身就是效应量——它同时告诉你关联方向(正/负)和强度(0-1)。r² 表示一个变量解释另一变量方差的比例(决定系数)。

Cohen(1988)r 的效应大小阈值

效应大小r 值
小效应.10
中效应.30
大效应.50

用途 2:非参数检验的效应量(r = Z/√N)

Mann-Whitney U 检验或 Wilcoxon 符号秩检验无法直接给出 Cohen's d,可用 r = Z / √N 作为效应量(其中 Z 是检验统计量的标准化值,N 是总样本量),阈值参照 Pearson r。

Cohen's f²:多元回归的局部效应量

在多元回归中,整体效应量用 R² / adjusted R²,而单个预测变量的局部效应量用 Cohen's f²

f² = R²_complete - R²_reduced / (1 - R²_complete)

其中 R²_complete 是含该变量的完整模型,R²_reduced 是去掉该变量的简化模型。

Cohen(1988)f² 的阈值

效应大小f² 值
小效应.02
中效应.15
大效应.35

六、Cramér's V — 卡方检验的效应量

定义与计算

卡方独立性检验(chi^2)检验两个分类变量是否独立,但 chi^2 的大小受样本量和表格维度影响,本身不是效应量。Cramér's V 将 chi^2 标准化为 0-1 的效应量:

V = sqrt(chi^2 / (N * (min(r, c) - 1)))

其中 N 为总样本量,r 为行数,c 为列数,min(r, c) - 1 是取行列数较小值减 1。

对于 2×2 列联表,Cramér's V = phi(φ)。

Cohen(1988)Cramér's V 阈值

阈值随列联表维度不同而不同(下表为 2 列 / 3 列 / 4+ 列时的参考值):

效应大小2×2 表(df=1)2×3 表(df=2)2×4 表(df=3)
小效应.10.07.06
中效应.30.21.17
大效应.50.35.29

通用简化参考(df = min(r-1, c-1) = 1 时,即 2×2 表):小 .10 / 中 .30 / 大 .50;其他维度效应阈值适当下调。

APA 报告格式

chi^2([df], N = [N]) = X.XX, p [值], Cramér's V = .XX([小/中/大]效应)

完整报告示例

卡方独立性检验结果显示,性别与是否重游之间存在显著关联,chi^2(1, N = 342) = 8.47,p = .004,Cramér's V = .16,为小至中效应(Cohen,1988)。


七、OR(优势比)— Logistic 回归的效应量

OR(Odds Ratio,优势比)作为 Logistic 回归的效应量,表示暴露变量每增加 1 个单位,结局发生优势的变化倍数:

  • OR = 1:无关联
  • OR > 1:正向关联(危险因素)
  • OR < 1:负向关联(保护因素)

报告格式

OR = X.XX, 95% CI [X.XX, X.XX], p [值]
调整 OR:aOR = X.XX, 95% CI [X.XX, X.XX], p [值]

OR 的效应大小参考:无普遍公认阈值,Cohen(1988)未覆盖 OR,通常结合临床/实践背景判断。粗略参考:OR 在 1.2-1.5 为弱,1.5-3.0 为中,>3.0 为强(正向);0.67-0.83 为弱,0.33-0.67 为中,<0.33 为强(保护)(经验参考,cf. Chen 2010;Chinn 2000,无统一权威阈值)。


八、在 ChatSRS 一句话获得所有效应量

打开 chatsrs.com,上传数据后输入:

t 检验

"对实验组和对照组的干预后得分做独立样本 t 检验,先做 Levene 方差齐性检验,输出 Cohen's d 效应量,并说明效应大小等级(参照 Cohen 1988),给出 APA 7th 格式完整报告段落。"

ANOVA

"对 4 种教学方法的期末成绩做单因素 ANOVA,输出 eta 平方和 omega 平方效应量;做双因素 ANOVA 时改输出偏 eta 平方(partial η²);效应大小参照 Cohen(1988)阈值,给出 APA 7th 格式报告。"

相关与回归

"计算 5 个变量的 Pearson 相关矩阵,在矩阵注释中标注 r 效应大小(小 .10 / 中 .30 / 大 .50);多元回归输出 R²、adjusted R²、各变量 Cohen's f²,给出 APA 7th 格式报告段落。"

卡方检验

"对性别和重游意愿做卡方独立性检验,输出 chi² 值、自由度、p 值、Cramér's V,给出 APA 7th 格式报告。"


九、方法章节如何声明效应量

APA 7th 要求方法章节提前说明将使用哪种效应量及其解读标准,以下为标准模板:

本研究报告 Cohen's d 作为 t 检验效应量,偏 eta 平方(partial η²)
作为双因素方差分析效应量,r 作为相关分析效应量,Cramér's V 作为
卡方检验效应量。效应大小均参照 Cohen(1988)的分类标准
(Cohen's d:小 = 0.20,中 = 0.50,大 = 0.80;
eta 平方 / partial eta 平方:小 = .01,中 = .06,大 = .14;
r:小 = .10,中 = .30,大 = .50;Cramér's V:
小 = .10,中 = .30,大 = .50(2×2 列联表))。

常见 FAQ

Q1:p 值已经显著了,还必须报告效应量吗?

必须报告,而且理由更充分。p 值只说明"是否有足够证据拒绝零假设",不说明"效应有多大"。审稿人和读者需要效应量来判断该结果是否有实践意义、是否值得后续研究投入资源。APA 7th 明确要求"每个推断统计均需报告效应量",不区分显著与否。只报告 p 值而不报告效应量,会被现代期刊直接要求补充修改。

Q2:为什么有些论文报告 partial η²,有些报告 η²?区别是什么?

核心区别:单因素 ANOVA 中两者相等,可以互用;双因素及以上 ANOVA 中 partial η² > η²,且两者含义不同。η² 的分母含所有因素和交互项的 SS,多个效应的 η² 加起来可能超过 1;partial η² 的分母只含该效应 SS + 误差 SS,反映该因素在控制其他因素后的独立贡献。多因素设计必须报告 partial η²,并在方法章节注明,不能用 η² 替代。SPSS 默认输出偏 eta 平方,R 的 effectsize::eta_squared(partial = TRUE) 显式指定。

Q3:Cohen(1988)的效应量阈值是否过时?

阈值本身不过时,但使用需要注意:Cohen(1988)的 .20/.50/.80(d)和 .01/.06/.14(η²)是跨领域的宽泛参考,Cohen 自己也说这些是"在没有更具体背景知识时的粗略参考"。现代统计学越来越强调:在发表的领域文献中参考典型效应量大小(如本领域效应量的第 25/50/75 百分位),而不是机械套用 Cohen 的小/中/大标签。报告效应量数值是必须的,如何解读则需结合学科背景和文献综述。

Q4:元分析中用 Hedges' g 还是 Cohen's d?

两者公式相似,Hedges' g 在 Cohen's d 基础上做了小样本无偏校正:g = d × J(J 为校正因子,略小于 1)。在元分析中,由于汇集了多个不同样本量的研究,标准做法是报告 Hedges' g(有些软件也写 g*)。单个研究报告 d,元分析报告 g。若单篇论文样本量较小(每组 n < 20),也建议报告 g 而非 d。


快速参考:效应量报告速查表

分析效应量格式Cohen 小/中/大
独立样本 tCohen's dd = X.XX0.20 / 0.50 / 0.80
配对样本 tCohen's d_zd_z = X.XX0.20 / 0.50 / 0.80
单因素 ANOVAη² 或 ω²η² = .XX 或 ω² = .XX.01 / .06 / .14
双因素+ ANOVApartial η²partial η² = .XX.01 / .06 / .14
Pearson 相关rr = .XX.10 / .30 / .50
多元回归(整体)R² / adj. R²R² = .XX
多元回归(单变量)Cohen's f²f² = .XX.02 / .15 / .35
卡方 2×2φ(phi)或 VV = .XX.10 / .30 / .50
卡方 2×kCramér's VV = .XX视 df 调整
Logistic 回归OR / aOROR = X.XX, 95% CI [X.XX, X.XX]结合背景判断
非参数(U/W)r = Z/√Nr = .XX.10 / .30 / .50

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。