统计百科 ·

Kruskal-Wallis 检验的 APA 报告怎么写?H值、事后 Dunn 比较格式全解

统计百科:专攻"非参多组比较怎么写进论文"——H(df)=X.XX 格式、中位数替代均值、Dunn 事后比较与 Bonferroni 校正、效应量 epsilon 平方,给出可直接套进论文的 APA 7th 完整模板,盘点最常见格式错误。

Kruskal-Wallis 检验的格式问题,不在于"会不会跑",而在于:H 值要带几个括号、中位数还是均值、Dunn 事后比较的 p 值怎么校正、效应量叫什么名字……这篇文章专攻"非参数多组比较怎么规范写进论文"这一具体格式点,给出 APA 7th 所有常见场景的完整模板,逐一盘点审稿人最常挑的错误。


你的 Kruskal-Wallis 报告有这些问题吗?

审稿人或导师关于非参数多组比较最常见的反馈:

  • "H 值要写自由度,格式是 H(df) = X.XX,不是单写 H = X.XX"
  • "非参数检验要报告中位数(Mdn)和四分位距(IQR),不应该只写均值"
  • "Dunn 事后比较需要注明是否做了 Bonferroni(或 BH)校正,已校正的 p 写成 p_adj"
  • "结果说'差异显著',但没写 H 统计量、自由度、p 值,格式不规范"
  • "没有效应量,请补充 epsilon 平方(epsilon^2)或 eta 平方(eta^2)"
  • "方法章节没说明为什么选非参数检验,须交代正态性假设不成立"

这些格式错误集中在 APA Publication Manual 第七版关于非参数检验报告的相关部分,但专门针对 Kruskal-Wallis 汇总的中文实操指南很少。本文只讲一件事:Kruskal-Wallis 检验及 Dunn 事后比较到底怎么规范写进论文的每一种场景

如果你还没看过姊妹篇 F 值的 APA 7th 报告写法,建议先读那篇了解参数检验基础,本文默认你已知道 p 值不加前导零(.032 而非 0.032)等基础格式规则,不再重复。


一、Kruskal-Wallis 检验是什么,什么时候用

统计直觉

Kruskal-Wallis 检验(以下简称 KW 检验)是单因素 ANOVA 的非参数替代,回答的问题是:

k 个独立样本的分布位置是否相同?

它不要求数据正态分布,也不要求方差齐性;它把所有观测值混合排秩,再比较各组的平均秩。H 统计量反映的就是"各组平均秩和全体平均秩之间的离散程度":

$H = \frac{12}{N(N+1)} \sum_{i=1}^{k} \frac{R_i^2}{n_i} - 3(N+1)$

其中 $R_i$ 是第 $i$ 组的秩和,$n_i$ 是组样本量,$N$ 是总样本量。

  • H 越大,说明各组分布位置差异越明显
  • 在各组 $n_i \geq 5$ 且 H_0 成立时,H 近似服从自由度为 $k-1$ 的卡方分布

选用 Kruskal-Wallis 的条件

满足以下任意一条,优先考虑 KW 而非 ANOVA:

条件说明
数据明显非正态Shapiro-Wilk p < .05,或样本量过小(< 30/组)难以验证正态
存在严重离群值无法删除且对均值影响显著
因变量为顺序量表李克特 5 点/7 点量表的原始分数
各组方差严重不等即使均值存在,也不满足 ANOVA 的方差齐性假设

二、H 值的自由度与格式

自由度只有一个

与 F 值(两个自由度)不同,H 值只有一个自由度

$df = k - 1$

其中 $k$ 是组数。3 组比较 → df = 2;4 组比较 → df = 3。

标准格式

H(df) = X.XX, p [= .XXX / < .001]
  • H 值精确到两位小数
  • 括号内填 df(整数)
  • p 值精确到三位小数,不加前导零;p = .000 改写为 p < .001
  • 有效位数与 F 值标准相同

正确示例

H(2) = 14.73, p = .001

常见错误对比

错误写法正确写法
H = 14.73, p = .001H(2) = 14.73, p = .001
H(2) = 14.73, p = .000H(2) = 14.73, p < .001
chi^2 = 14.73H(2) = 14.73(Kruskal-Wallis 用 H,不写成卡方形式)
H(2) = 14.7H(2) = 14.73(保留两位小数)

注意:部分统计软件(SPSS、R)的输出中 Kruskal-Wallis 显示为 "Chi-Square",但 APA 写进论文时应写 H,不应直接抄软件符号。


三、描述统计:中位数替代均值

为什么报告中位数

KW 检验基于秩而非原始数值,意味着它对分布中心位置(位置参数)敏感,而"位置"最自然的描述量是中位数(Mdn),而不是均值。

APA 7th 要求在非参数检验报告中:

  • Mdn 表示中位数(不写 Median 或 M)
  • IQR 表示四分位距(Q3 - Q1)
  • 或报告 25th–75th 百分位数范围

格式

组名(Mdn = X.XX, IQR = X.XX)

或更完整:

组名(Mdn = X.XX, Q1 = X.XX, Q3 = X.XX)

正确示例

各组满意度中位数分别为:A 组(Mdn = 4.50, IQR = 1.25)、B 组(Mdn = 3.00, IQR = 2.00)、C 组(Mdn = 5.00, IQR = 0.75)。


四、效应量:epsilon 平方与 eta 平方

效应量是必须报告的

APA 7th 要求所有推断统计报告效应量,KW 检验也不例外。

KW 检验常用的效应量有两种:

效应量公式特点
epsilon^2(epsilon squared)$\epsilon^2 = (H - k + 1) / (N - k)$(近似无偏修正)更精确,偏小样本无偏
eta^2(eta squared)$\eta^2_H = H / (N - 1)$简单,部分软件直接输出

Cohen(1992)非参数效应量参考标准

效应大小epsilon^2 / eta^2
小效应.01
中效应.06
大效应.14

(与 ANOVA 的 eta^2 参考标准相同,便于跨方法比较)

格式示例

epsilon^2 = .XX 或 eta^2 = .XX([大小]效应)

注意:部分文献将 KW 的效应量写为 $\eta^2_H$ 以区别于 ANOVA 的 eta^2,在论文方法章节需注明计算公式来源。


五、Dunn 事后比较:格式与校正方法

当 KW 检验整体显著(p < .05)时,需要进行成对事后比较以找出是哪些组之间存在差异。最常用的是 Dunn 检验(1964)。

校正方法选用

方法特点推荐场景
Bonferroni保守,控制 FWER组数少(≤ 4 组)、首选保守
Holm-Bonferroni比 Bonferroni 功效稍高一般推荐
Benjamini-Hochberg(BH)控制 FDR,功效更高组数多(> 4 组)

APA 7th 要求在方法章节注明所使用的校正方法,并在结果段明确写"Bonferroni 校正后"或"BH 校正后"。

格式

Dunn 事后比较(Bonferroni 校正)显示,[组A] 显著[高于/低于] [组B]
(p_adj [= .XXX / < .001]);[组A] 与 [组C] 差异不显著(p_adj = .XXX)。
  • 校正后的 p 写为 $p_{adj}$ 或 p_adj
  • 也可写原始 p 并注明"已做 Bonferroni 校正"
  • 结合中位数报告,读者可判断方向

六、APA 完整报告模板(可抄进论文)

场景一:三组独立样本比较(最常见)

情形:比较三种干预方式(A/B/C)对患者疼痛评分(1–10 分李克特)的影响,总样本 N = 90,每组 30 人。

结果段落模板

[因变量]的 Shapiro-Wilk 正态性检验显示,[至少一组]数据显著偏离正态分布,
W([n]) = X.XX,p [值],因此采用 Kruskal-Wallis 检验进行组间比较。
结果显示,三组[因变量]存在显著差异,H(k-1) = X.XX,p [值],
epsilon^2 = .XX,为[大小]效应。各组中位数分别为:
[组A](Mdn = X.XX,IQR = X.XX)、[组B](Mdn = X.XX,IQR = X.XX)、
[组C](Mdn = X.XX,IQR = X.XX)。
进一步的 Dunn 事后比较(Bonferroni 校正)显示,
[组A] 显著低于 [组C](p_adj = .XXX);
[组B] 与 [组C] 差异显著(p_adj = .XXX);
[组A] 与 [组B] 差异未达显著(p_adj = .XXX)。

填入数值的示例(可直接套用)

疼痛评分的 Shapiro-Wilk 检验显示,B 组(W = .89,p = .006)和 C 组(W = .91,p = .018)均显著偏离正态分布,因此采用 Kruskal-Wallis 检验进行组间比较。结果显示,三种干预方式对疼痛评分的效应存在显著差异,H(2) = 14.73,p = .001,epsilon^2 = .16,为大效应(Cohen,1992)。各组疼痛评分中位数分别为:A 组(Mdn = 7.00,IQR = 2.00)、B 组(Mdn = 5.00,IQR = 2.25)、C 组(Mdn = 3.50,IQR = 1.75)。进一步的 Dunn 事后比较(Bonferroni 校正)显示,A 组疼痛评分显著高于 C 组(p_adj = .001);B 组显著高于 C 组(p_adj = .038);A 组与 B 组差异未达显著(p_adj = .094)。


场景二:四组或更多组比较(BH 校正)

情形:比较四个地区(东/南/西/北)消费者对产品的满意度(顺序量表),N = 200。

结果段落模板

Kruskal-Wallis 检验结果显示,四个地区消费者满意度存在显著差异,
H(3) = X.XX,p [值],eta^2 = .XX([大小]效应)。
各地区中位数分别为:东区(Mdn = X.XX,IQR = X.XX)、
南区(Mdn = X.XX)、西区(Mdn = X.XX)、北区(Mdn = X.XX)。
采用 Dunn-Bonferroni(或 BH)事后检验进行成对比较,
显著差异见下表(p_adj < .05 以粗体标出)。

填入数值的示例

各地区消费者满意度的 Kruskal-Wallis 检验结果显示,四个地区间存在显著差异,H(3) = 22.48,p < .001,eta^2 = .11,为大效应。各地区满意度中位数分别为:东区(Mdn = 4.00,IQR = 1.00)、南区(Mdn = 3.00,IQR = 1.50)、西区(Mdn = 4.00,IQR = 1.25)、北区(Mdn = 2.50,IQR = 2.00)。采用 Dunn 事后检验并以 Benjamini-Hochberg 方法校正多重比较,东区与北区(p_adj = .001)及南区与北区(p_adj = .003)满意度差异显著;其余各对差异均未达显著(所有 p_adj > .05)。


场景三:方法章节标准描述

因[因变量]在[某/多个]组中的 Shapiro-Wilk 正态性检验结果显著(p < .05),
违反了参数检验的正态性假设,故采用 Kruskal-Wallis 检验(非参数单因素方差分析)
比较 [k] 组 [因变量] 的差异。若整体检验显著,以 Dunn 检验进行成对事后比较,
并采用 Bonferroni 方法校正 I 类错误(alpha = .05)。
效应量报告 epsilon 平方(epsilon^2),
参照 Cohen(1992)标准(.01 = 小,.06 = 中,.14 = 大效应)。
统计分析使用 ChatSRS(R 引擎 dunn.test 包),显著性水平 alpha = .05。

七、在 ChatSRS 一句话获得规范 KW 报告

打开 chatsrs.com,上传数据后输入:

"对三种干预方式的疼痛评分做 Kruskal-Wallis 检验,先做 Shapiro-Wilk 正态性检验说明选非参数的理由;整体显著后做 Dunn 事后比较并用 Bonferroni 校正;输出 H 值(含自由度)、p 值、epsilon 平方效应量、各组中位数与 IQR,并给出符合 APA 7th 格式的完整报告段落。"

ChatSRS 自动判断正态性、输出 H 统计量、效应量和 Dunn 事后比较矩阵,并生成可直接复制进论文的 APA 格式段落,数值已填入,无需手动排版。


八、Kruskal-Wallis 报告常见错误对照表

常见错误正确写法违反的规则
H = 14.73H(2) = 14.73df 须写入括号
chi^2(2) = 14.73H(2) = 14.73KW 统计量写 H,非卡方
p = .000p < .001.000 是舍入假值
M = XX, SD = XXMdn = XX, IQR = XX非参数用中位数而非均值
无效应量epsilon^2 = .16APA 7th 要求效应量
Dunn 未注明校正方法注明"Bonferroni 校正"多重比较须明确校正
p_adj = .000p_adj < .001同 p 值规范
"结果不显著,无需效应量"仍须报告 epsilon^2效应量不依赖显著性

常见 FAQ

Q:Kruskal-Wallis 检验和 Mann-Whitney U 检验有什么区别,什么时候用哪个?

A:Mann-Whitney U 专门用于两组独立样本比较(相当于两样本非参数 t 检验);Kruskal-Wallis 用于三组及以上独立样本比较(相当于非参数单因素 ANOVA)。如果只有两组,直接用 Mann-Whitney U 即可,不必做 Kruskal-Wallis 再做 Dunn 后比较;若三组以上,先做 Kruskal-Wallis 整体检验,整体显著才做 Dunn 事后比较(避免多重比较的 I 类错误膨胀)。在 APA 报告中,两组写 U 统计量,三组以上写 H 统计量,格式不同。

Q:KW 检验整体 p > .05,还需要做 Dunn 事后比较吗?

A:不需要。Kruskal-Wallis 的整体 H 检验是"守门员":只有 H 检验整体显著(p < .05)时,才有统计依据去寻找具体是哪两组有差异,此时才进行 Dunn 事后比较。若整体 p > .05,直接报告"各组差异未达显著,H(df) = X.XX,p = .XXX"即可,不再进行成对比较——那样做会增加 I 类错误概率,且与整体检验结论矛盾。

Q:Dunn 检验、Steel-Dwass 检验和 Conover 检验有什么区别?

A:三者都是 KW 显著后的事后检验,但方法不同。Dunn 检验(最常用)基于标准化秩差,配合 Bonferroni/BH 校正,简单直观;Steel-Dwass 检验(又叫 Dwass-Steel-Critchlow-Fligner)不依赖 Bonferroni,通过模拟精确控制 FWER,适合强调家族错误率时;Conover 检验功效最高但对正态性有一定依赖,若原始数据偏正态可选。实际论文中 Dunn + Bonferroni(或 BH)已被大多数期刊接受;若导师或期刊有特殊要求,在方法章节注明所用检验即可。ChatSRS 三种都支持,输出时会标注方法名。

Q:用 epsilon^2 还是 eta^2 作为 KW 效应量?

A:两者都被文献引用,但有细微差别。epsilon^2 是 Kelley(1935)无偏估计,公式为 $\epsilon^2 = (H - k + 1)/(N - k)$,对小样本偏差修正更好,是近年非参数效应量文献(Tomczak & Tomczak,2014;Fritz et al.,2012)推荐的首选。eta^2(eta^2_H) 即 $H/(N-1)$,计算更简单,历史上较常见,但会高估效应量(尤其小样本)。在 APA 报告中若不确定,优先写 epsilon^2 并注明来源公式;若目标期刊有约定格式,以期刊要求为准。ChatSRS 默认同时输出两者,建议根据目标期刊选用。


快速参考:KW 报告格式速查卡

[Kruskal-Wallis 整体检验]
H(k-1) = X.XX, p [= .XXX / < .001], epsilon^2 = .XX

[描述统计(非参数)]
组名(Mdn = X.XX, IQR = X.XX)

[Dunn 事后比较]
Dunn 检验(Bonferroni 校正):组A vs. 组B,p_adj = .XXX
注:整体 H 不显著则不做事后检验

[方法章节说明]
"因 X 不满足正态性假设(Shapiro-Wilk p < .05),
采用 Kruskal-Wallis 非参数检验,事后 Dunn 检验 + Bonferroni 校正,
效应量 epsilon^2,alpha = .05"

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。