统计百科 ·

Cohen's d 与 Hedges' g 怎么选?效应量小样本校正全解 — d vs g、Glass Δ、APA报告

统计百科:深度拆解 Cohen's d 与 Hedges' g 的核心差异——小样本偏差从哪来、校正因子 J 怎么算、Glass Δ 何时替换、效应量阈值判读、以及可直接套用进论文的 APA 7th 完整报告句式。

审稿人批注"效应量计算不当"、导师质疑"小样本直接用 d 会高估效应"……这两句话背后指向同一个知识点:Cohen's d 在小样本条件下存在上偏(overestimation),而 Hedges' g 正是为此设计的校正版本。本文从偏差来源出发,逐步讲清楚三种标准化均值差(Cohen's d、Hedges' g、Glass Δ)的适用边界,附 APA 7th 可直接抄用的报告句式,以及在 ChatSRS 一句话完成全流程计算的指令模板。


你的论文效应量报告有这些问题吗?

在两组比较中,以下错误每天在成千上万篇论文草稿里出现:

  • "小样本(每组 n < 20)直接报告 Cohen's d,没有做小样本校正"
  • "Glass Δ 和 Cohen's d 混用,两组方差不齐时仍用合并标准差"
  • "效应量大小(小/中/大)没有引用 Cohen(1988)标准,审稿人要求补引"
  • "报告了 d = 0.52,但没说用的是哪种公式(独立样本?配对样本?)"
  • "Hedges' g 的校正因子 J 没有报告,读者无法验证"

这些问题集中指向一个核心:Cohen's d、Hedges' g 和 Glass Δ 不是同一个东西,且在样本量不同、方差齐性不同、研究设计不同时,选择不同指标会导致显著的数值差异。


一、标准化均值差家族:三个指标的共同起点

为什么需要标准化均值差

两组比较时,原始均值差(M1 - M2)的大小取决于测量单位——用厘米还是毫米量身高,得到的"差值"差 100 倍,但效应完全相同。标准化均值差把均值差除以某种标准差,消除单位影响,得到一个可以跨研究比较的无量纲效应量:

$\text{标准化均值差} = \frac{M_1 - M_2}{S_{\text{某种标准差}}}$

三种指标的区别,全在分母用什么标准差:

指标分母适用条件
Cohen's d合并标准差(假设两组方差相等)大样本、方差齐性
Hedges' g合并标准差 + 小样本校正因子 J小样本(每组 n < 20~50)
Glass Δ仅用对照组(控制组)标准差方差不齐、有明确对照组

二、Cohen's d:公式、适用范围与小样本偏差

公式

独立样本(等 n)最简形式:

$d = \frac{M_1 - M_2}{S_p}$

其中合并标准差:

$S_p = \sqrt{\frac{(n_1-1)S_1^2 + (n_2-1)S_2^2}{n_1 + n_2 - 2}}$

配对样本(前后测)版本分母改用差值的标准差:

$d_{paired} = \frac{M_{diff}}{S_{diff}}$

效应量阈值(Cohen,1988)

效应大小Cohen's d / Hedges' g
小效应0.20
中效应0.50
大效应0.80

注意:Cohen 本人在 1988 年的著作中强调,这些阈值是"大拇指规则",不应机械套用,需结合领域惯例和研究背景判读。

小样本上偏问题

Cohen's d 使用样本标准差 $S_p$ 作为总体标准差 $\sigma$ 的估计量。当样本量较小时,$S_p$ 往往低估总体标准差(方差估计本身是无偏的,但标准差是方差的非线性变换,开方后引入小样本偏差),导致计算出的 d 值系统性偏大

数学上,$d$ 的期望值为:

$E[d] = \delta \cdot \sqrt{\frac{N-2}{2}} \cdot \frac{\Gamma\left(\frac{N-3}{2}\right)}{\Gamma\left(\frac{N-2}{2}\right)} \approx \delta \cdot \left(1 + \frac{3}{4(N-2)-1}\right)$

其中 $\delta$ 是总体真值,$N = n_1 + n_2$。偏差量约为 $3 / [4(N-2)-1]$——样本越小,偏差越大。

直观感受:每组 n=5(总 N=10)时,d 平均高估约 11%;每组 n=10 时约高估 5%;每组 n=50 时约高估 1%,此时偏差可忽略。


三、Hedges' g:小样本校正因子 J

公式

Hedges(1981)提出用校正因子 $J$ 消除上偏:

$g = J \cdot d$

校正因子 $J$ 的精确公式:

$J = \frac{\Gamma\left(\frac{N-2}{2}\right)}{\sqrt{\frac{N-2}{2}} \cdot \Gamma\left(\frac{N-3}{2}\right)}$

实践中常用近似公式(误差极小):

$J \approx 1 - \frac{3}{4(N-2) - 1}$

其中 $N = n_1 + n_2$(独立样本),配对样本时 $N = n$(差值对数)。

$J$ 始终小于 1,因此 $g < d$——g 是 d 经过下调之后的无偏估计量。

何时用 g 而非 d

实践标准(综合 Hedges & Olkin,1985;Field,2013 推荐):

每组 n偏差程度建议
< 10> 10%,不可忽略必须报告 g
10-205%-10%强烈建议报告 g
20-502%-5%建议报告 g,或同时报告 d 与 g
> 50< 2%d 与 g 差异微小,两者均可接受

**元分析(meta-analysis)**几乎统一要求报告 Hedges' g,因为荟萃来自不同 n 的研究,必须使用无偏估计才能公平合并。


四、Glass Δ:方差不齐时的替代方案

公式

$\Delta = \frac{M_1 - M_2}{S_2}$

分母只用对照组(control group)的标准差,不合并两组。

使用场景

Cohen's d 和 Hedges' g 都假设两组总体方差相等($\sigma_1 = \sigma_2$),当这一假设不成立时,合并标准差 $S_p$ 本身就是有问题的,效应量估计失去意义。Glass Δ 绕开这个问题:

  1. 干预研究:实验组经过处理,方差可能随均值变化(Levene 检验显著)
  2. 对照组是"基准":研究者认为对照组的 SD 代表总体基线变异,实验组的变化不应影响分母
  3. Levene's F 检验显著(p < .05)且有明确对照组

Glass Δ 同样适用 Cohen(1988)的大小阈值(0.2/0.5/0.8),但方向性解读需注意:$\Delta$ 表达的是"干预效果相当于基线标准差的多少倍"。


五、三种指标的选用决策树

有两组均值比较需要效应量
        |
        v
方差不齐(Levene p < .05)且有明确对照组?
    |            |
   否            是
    |            +---> 考虑 Glass Δ
    v
每组 n < 50?
    |       |
   是       否
    |       +---> Cohen's d(偏差 < 2%,可接受)
    v
每组 n < 20?
    |        |
   是        否(20-50)
    |        +---> Hedges' g(推荐)或报告 d + g 两者
    v
Hedges' g(必须,偏差 > 5%)

元分析或荟萃文献综述 --> 统一用 Hedges' g

六、APA 7th 报告句式(可直接抄入论文)

独立样本 t 检验 + Cohen's d(大样本)

独立样本 t 检验结果显示,实验组(M = XX, SD = XX)与
对照组(M = XX, SD = XX)的[因变量]差异显著,
t([df]) = X.XX, p [= .XXX / < .001], Cohen's d = X.XX,
为[小/中/大]效应(Cohen,1988)。

填入数值的示例

独立样本 t 检验结果显示,干预组(M = 78.4,SD = 9.2)的前测-后测增益显著高于对照组(M = 71.1,SD = 8.8),t(148) = 4.72,p < .001,Cohen's d = 0.81,为大效应(Cohen,1988)。

独立样本 t 检验 + Hedges' g(小样本)

独立样本 t 检验结果显示,两组[因变量]差异显著,
t([df]) = X.XX, p [= .XXX / < .001]。
鉴于每组样本量较小(n1 = XX, n2 = XX),
报告经小样本校正的 Hedges' g = X.XX(校正因子 J = X.XXX),
为[小/中/大]效应(Cohen,1988;Hedges & Olkin,1985)。

填入数值的示例

独立样本 t 检验结果显示,实验组(M = 42.3,SD = 7.6,n = 12)与对照组(M = 36.8,SD = 8.1,n = 11)在焦虑量表得分上的差异显著,t(21) = 2.14,p = .044。鉴于每组样本量较小(n < 20),报告经小样本校正的 Hedges' g = 0.68(校正因子 J = 0.964),为中效应(Cohen,1988;Hedges & Olkin,1985)。

配对样本 t 检验 + Hedges' g(前后测)

配对样本 t 检验结果显示,前测(M = XX, SD = XX)与
后测(M = XX, SD = XX)差异显著,
t([n-1]) = X.XX, p [值], Hedges' g = X.XX(校正因子 J = X.XXX),
为[大小]效应(Cohen,1988)。

Glass Δ(方差不齐时)

Levene 方差齐性检验显著,F([df1], [df2]) = X.XX, p = .XXX,
两组方差存在显著差异,采用 Glass Δ 作为效应量指标,
以对照组标准差(SD_control = XX)为分母。
结果显示,Glass Δ = X.XX,为[大小]效应(Cohen,1988)。

七、方法章节怎么说明效应量选择

说清楚为什么选这个指标,是高质量方法章节的标志:

大样本场景(每组 n > 50):

两组差异的效应量采用 Cohen's d(Cohen,1988);
两组样本量均 > 50,小样本偏差(< 2%)可忽略不计。
效应量大小参照 Cohen(1988)标准:d = 0.20 为小效应,
0.50 为中效应,0.80 为大效应。

小样本场景(每组 n < 20):

鉴于每组样本量较小(n < 20),效应量采用经小样本校正的
Hedges' g(Hedges & Olkin,1985),以减少 Cohen's d 在
小样本条件下对真实效应量的系统性高估。
校正因子 J 通过精确公式计算,并在结果部分一并报告。

方差不齐场景

Levene 检验结果显示两组方差存在显著差异(p < .05),
违反 Cohen's d 合并标准差的等方差假设,
因此采用 Glass Δ(Glass,McGaw & Smith,1981)——
以对照组标准差为分母——作为效应量指标。

八、在 ChatSRS 一句话获得完整效应量报告

打开 chatsrs.com,上传包含两组数据的文件(Excel/CSV/SPSS sav 均可)后输入:

"对实验组和对照组的[因变量]做独立样本 t 检验,先做 Levene 方差齐性检验;样本量较小(每组 n < 20),报告经小样本校正的 Hedges' g 和校正因子 J,同时给出 Cohen's d 作对比;输出 APA 7th 格式的完整报告段落,包含各组 M、SD、t 值、自由度、p 值、效应量及效应大小描述。"

ChatSRS 输出段落即可直接复制进论文方法与结果章节,数值自动从你上传的数据中计算。如需 Glass Δ,在指令末尾补充"若 Levene 检验显著,改用 Glass Δ 并说明理由"。


常见 FAQ

Q:Hedges' g 和 Cohen's d 在大样本(每组 n = 200)时差多少?

A:差异极小,可忽略。当每组 n = 200 时,校正因子 J ≈ 1 - 3/(4×398-1) ≈ 0.9981,g = d × 0.9981,两者相差不到 0.2%。大样本时报告 d 或 g 均符合 APA 7th 规范,选哪个取决于目标期刊惯例。若不确定,同时报告"Cohen's d = 0.52,经小样本校正 Hedges' g = 0.52,差异可忽略"是最保险的做法。

Q:元分析为什么必须用 Hedges' g 而不能用 Cohen's d?

A:元分析要把来自不同研究的效应量合并为加权平均值。各研究样本量差异悬殊,有的每组 n = 8,有的每组 n = 300。小样本研究的 d 值系统性偏大,若直接合并,大效应会被小样本研究"拉高",产生虚假的汇总效应。Hedges' g 消除了这种偏差,使每个研究贡献的效应量估计均无偏,合并后的汇总 g 才是对真实总体效应的公正估计。这也是 Cochrane 系统综述和大多数心理学 meta-analysis 手册的统一要求。

Q:Glass Δ 和 Hedges' g 能同时出现在一篇论文里吗?

A:能,且有时是推荐做法。当方差不齐时,报告 Glass Δ 为主要效应量,同时报告 Hedges' g 作为参照(并注明"由于方差不齐,g 的解释需谨慎"),让读者看到两种计算方式下的效应量范围,透明度更高。方法章节要明确说明选择 Δ 为主指标的理由(Levene 检验结果)。

Q:效应量 d = 0.45,算中效应还是小效应?

A:按 Cohen(1988)的阈值严格来说是"小效应"(< 0.50)。但实践中,0.45 已经非常接近中效应阈值,描述时可以说"接近中等效应"(approaching medium effect)或"小至中等效应"(small-to-medium effect),避免给读者留下"效应微不足道"的误导。更重要的是:效应量大小的解读要结合领域惯例——临床心理学中 d = 0.45 的干预效果相当不错,而某些认知实验中 d = 0.45 可能属于预期内的小效应。APA 7th 本身也建议"不要将统计显著性阈值机械套用于效应量大小判断"。


快速参考:三种效应量速查卡

[独立样本,方差齐性,每组 n > 50]
Cohen's d = (M1 - M2) / Sp
Sp = sqrt([(n1-1)S1^2 + (n2-1)S2^2] / [n1+n2-2])
效应大小: 小=0.20, 中=0.50, 大=0.80

[独立样本,小样本(每组 n < 20~50)]
Hedges' g = J * d
J ≈ 1 - 3 / (4*(n1+n2-2) - 1)
报告格式: g = X.XX(J = X.XXX)

[独立样本,方差不齐(Levene p < .05)+ 有明确对照组]
Glass Delta = (M_exp - M_ctrl) / SD_ctrl
分母只用对照组(control)标准差

[配对样本 / 前后测]
d_paired = M_diff / SD_diff
g_paired = J * d_paired,J 中 N 换成 n(差值对数)

[元分析]
统一使用 Hedges' g(无偏估计,跨研究可比)

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。