统计百科 ·

非参数检验APA报告怎么写 — Mann-Whitney U / Kruskal-Wallis H / Wilcoxon W 格式全解

统计百科:专攻非参数检验APA 7th报告格式——Mann-Whitney U值、Kruskal-Wallis H值、Wilcoxon W值的完整写法,中位数怎么报告、效应量r如何计算与呈现,给出可直接套用进论文的APA报告模板,并盘点最常见的格式错误。

非参数检验是参数检验"跑不下去"时的必选项:数据严重偏态、样本量太小、测量层次只到序数……但很多研究者拿到结果后反而更迷茫——U 值、H 值、W 值到底怎么写进论文?中位数要不要报告、效应量用哪个指标、APA 7th 对这些检验有没有特殊要求?这篇文章给出全部答案,并附上可直接复制进方法章节和结果章节的完整模板。


你的非参数检验报告有这些问题吗?

导师或审稿人关于非参数检验报告最常见的反馈:

  • "Mann-Whitney U 要报告两个组的中位数,只写 U 值没有描述统计"
  • "效应量在哪里?非参数检验也要报告 r 或 eta^2"
  • "Wilcoxon 符号秩检验的统计量是 W 还是 Z?两者都要报告吗"
  • "Kruskal-Wallis 显著了,但事后比较方法是什么?用 Dunn 还是 Bonferroni"
  • "样本量 N 写的是总人数还是各组人数?"
  • "p < .05 写对了,但 APA 不加前导零——你写的是 p = 0.032"

这些问题集中在 APA Publication Manual 第七版关于推断统计报告、描述统计以及效应量报告的多个规定上,而市面上针对非参数检验格式的汇总资料极少。本文只讲一件事:非参数检验统计量如何规范写进论文的每一种场景

如果你还没看过姊妹篇 t 值的 APA 7th 报告写法F 值的 APA 7th 报告写法,建议先读那两篇,本文默认你已了解 p 值不加前导零(.032 而非 0.032)等基础格式规则,不再重复。


一、什么时候应该用非参数检验

非参数检验的四个适用场景

非参数检验(Non-parametric tests)不依赖"总体服从正态分布"的假设,适用于:

场景对应参数检验对应非参数检验
两独立样本比较,数据非正态或序数独立样本 t 检验Mann-Whitney U 检验
三组及以上独立样本比较单因素 ANOVAKruskal-Wallis H 检验
配对/同一被试两次测量比较配对样本 t 检验Wilcoxon 符号秩检验
三个及以上相关测量比较重复测量 ANOVAFriedman 检验

非正态的判断依据

选择非参数检验前,方法章节应说明正态性检验结果:

  • Shapiro-Wilk 检验(推荐,N < 50 时尤其适合):W = .XXX,p = .XXX
  • Kolmogorov-Smirnov 检验(大样本):D(N) = .XXX,p = .XXX
  • 或陈述"数据呈明显正偏态(偏度 = X.XX)/存在显著异常值,不满足参数检验的正态性假设,故采用非参数方法"

二、APA 7th 非参数检验报告通用要素

无论哪种非参数检验,APA 7th 要求报告以下要素:

要素格式说明
检验统计量U / H / W,精确到两位小数(整数则不加小数点)
样本量各组 n,或总 N
p 值精确三位小数;p < .001 时写 p < .001
效应量r(常用)或 epsilon^2(Kruskal-Wallis)
描述统计中位数 Mdn 和四分位距 IQR(不是均值 M)

关键点:非参数检验用**中位数(Mdn)而非均值(M)来描述集中趋势,用四分位距(IQR)**而非标准差(SD)来描述离散程度,这与参数检验有本质区别。


三、Mann-Whitney U 检验:两独立样本非参数比较

U 值是什么

Mann-Whitney U 检验比较两组序数或非正态连续数据的分布是否有差异。其统计量 U 等于"第一组每个观测值大于第二组每个观测值的对数"。

$U_1 = n_1 n_2 + \frac{n_1(n_1+1)}{2} - R_1$

其中 $R_1$ 是第一组所有观测值的秩之和。通常报告两个 U 值中较小的那个(有些软件直接输出 Z 近似值,两者均可报告)。

APA 报告格式:Mann-Whitney U

必报要素

Mann-Whitney U([n1, n2 或省略]) = X.XX, p = .XXX, r = .XX
附:各组 Mdn 和 IQR

APA 7th 对 Mann-Whitney U 的括号内自由度并无强制要求——若软件不输出可省略,保留 U 值和 p 值即可。效应量 r 的计算为:

$r = \frac{Z}{\sqrt{N}}$

其中 Z 是 Mann-Whitney 检验的标准化统计量,N 是总样本量(= n1 + n2)。

效应量大小判断标准(Cohen, 1992):

大小r 值
小效应.10
中效应.30
大效应.50

完整报告模板(Mann-Whitney U)

Mann-Whitney U 检验结果显示,[组1](Mdn = XX, IQR = XX)与[组2]
(Mdn = XX, IQR = XX)在[因变量]上的差异[显著/未达显著],
U = X.XX, p [= .XXX / < .001], r = .XX([大小]效应)。

填入数值的示例

Mann-Whitney U 检验结果显示,实验组(Mdn = 78.00,IQR = 14.50)在疼痛评分上显著低于对照组(Mdn = 62.00,IQR = 19.00),U = 312.00,p = .003,r = .41,为中大效应。

报告 Z 近似值的变体格式

当样本量较大(通常 n > 20),软件会使用正态近似输出 Z 值,此时格式为:

Mann-Whitney U = X.XX, Z = X.XX, p [值], r = .XX

示例

Mann-Whitney U = 3182.00,Z = -3.47,p < .001,r = .34,为中效应,表明女性被试(Mdn = 52,IQR = 18)在焦虑量表得分上显著高于男性被试(Mdn = 44,IQR = 15)。


四、Kruskal-Wallis H 检验:三组及以上独立样本非参数比较

H 值是什么

Kruskal-Wallis H 检验是单因素 ANOVA 的非参数替代,检验三组及以上独立样本的分布是否相同。H 统计量近似服从 chi^2 分布,自由度 df = k - 1(k 为组数)。

$H = \frac{12}{N(N+1)}\sum_{j=1}^{k}\frac{R_j^2}{n_j} - 3(N+1)$

APA 报告格式:Kruskal-Wallis H

必报要素

H([df]) = X.XX, p = .XXX, epsilon^2 = .XX
附:各组 Mdn 和 IQR,若整体显著则加事后比较

效应量 epsilon^2(Kruskal-Wallis 专用;注:此式为 Tomczak & Tomczak (2014) 定义的 epsilon-squared,与严格意义上的 eta^2_H 分母不同,部分软件及文献将其标注为 eta^2_H,本文统一采用 epsilon^2):

$\epsilon^2 = \frac{H - k + 1}{N - k}$

效应量大小标准(同 ANOVA 的 eta^2):

大小epsilon^2
小效应.01
中效应.06
大效应.14

完整报告模板(Kruskal-Wallis H)

Kruskal-Wallis H 检验结果显示,[自变量]对[因变量]的效应[显著/不显著],
H([k-1]) = X.XX, p [= .XXX / < .001], epsilon^2 = .XX([大小]效应)。
各组描述统计:[组1]Mdn = XX, IQR = XX;[组2]Mdn = XX, IQR = XX;
[组3]Mdn = XX, IQR = XX。
Dunn 事后多重比较(Bonferroni 校正)显示,[显著组对描述];
[不显著组对描述](均 p > .05)。

填入数值的示例

Kruskal-Wallis H 检验结果显示,三种干预方式(认知行为/正念/对照)对抑郁症状改善分的效应显著,H(2) = 14.32,p < .001,epsilon^2 = .142,为大效应。各组描述统计:认知行为组 Mdn = 12.00,IQR = 7.50;正念组 Mdn = 10.00,IQR = 6.00;对照组 Mdn = 5.00,IQR = 8.00。Dunn 事后多重比较(Bonferroni 校正)显示,认知行为组显著优于对照组(p = .001);正念组亦显著优于对照组(p = .008);认知行为组与正念组之间差异未达显著(p = .214)。

Kruskal-Wallis 的事后比较怎么写

H 检验整体显著后,需要进行事后两两比较,常用方法:

方法适用场景校正方式
Dunn 检验(推荐)组数 3-6,是最常见的选择Bonferroni 或 Benjamini-Hochberg
Conover-Iman 检验组间方差相近Bonferroni
Mann-Whitney U(简单粗暴)只有 3 组时有时用手动 Bonferroni(alpha / 比较次数)

方法章节说明:

Kruskal-Wallis 检验显著时,以 Dunn 检验进行事后两两比较,
并采用 Bonferroni 方法校正多重比较(调整后显著性水平 alpha = .05/[比较次数])。

五、Wilcoxon 符号秩检验:配对/重复测量非参数比较

W 值与 Z 值的关系

Wilcoxon 符号秩检验(Wilcoxon Signed-Rank Test)是配对样本 t 检验的非参数替代,适用于配对数据不满足正态性假设时。

统计量 W(或 T)等于正秩之和(或负秩之和中较小的那个)。当样本量较大时(n > 25),W 近似服从正态分布,软件会同时输出 Z 近似值。

两者均可报告,但若只报告其一:

  • 小样本(n <= 25):报告 W(精确检验)
  • 大样本(n > 25):报告 Z 近似值更稳健,同时也可附上 W

APA 报告格式:Wilcoxon 符号秩检验

效应量 r(同 Mann-Whitney,用 Z 近似值计算):

$r = \frac{Z}{\sqrt{N}}$

注意:此处 N = 有效配对数(不包含差值为 0 的配对)。

完整报告模板(Wilcoxon 符号秩检验)

Wilcoxon 符号秩检验结果显示,[前测](Mdn = XX, IQR = XX)与
[后测](Mdn = XX, IQR = XX)之间的差异[显著/不显著],
W = X.XX(或 Z = X.XX), p [= .XXX / < .001], r = .XX([大小]效应)。

小样本示例(精确 W)

Wilcoxon 符号秩检验结果显示,干预后疼痛评分(Mdn = 3.00,IQR = 2.00)显著低于干预前(Mdn = 7.00,IQR = 3.00),W = 18.00,p = .012,r = .56,为大效应,表明干预措施有效降低了被试的疼痛感知。

大样本示例(Z 近似)

Wilcoxon 符号秩检验结果显示,使用 ChatSRS 后的分析效率评分(Mdn = 8.00,IQR = 2.00)显著高于使用前(Mdn = 5.00,IQR = 3.00),Z = -4.23,p < .001,r = .59,为大效应。


六、方法章节标准写法

报告选用非参数检验的依据

方法章节应明确说明使用非参数检验的原因,不能只写"使用了 Mann-Whitney U 检验"而不说为什么。标准写法:

数据正态性检验采用 Shapiro-Wilk 检验,结果显示[因变量]未满足正态性假设
(W = .XX, p = .XXX),因此采用 Mann-Whitney U 检验代替独立样本 t 检验
比较两组差异。效应量采用 r(r = Z/√N),参照 Cohen(1992)标准
(.10 = 小效应,.30 = 中效应,.50 = 大效应)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。

完整方法章节(Kruskal-Wallis 版本)

各组[因变量]均未通过 Shapiro-Wilk 正态性检验(所有 p < .05),
且各组样本量均小于 30,不满足参数检验条件,因此采用 Kruskal-Wallis H 检验
比较三组差异。检验统计量 H 近似服从 chi^2 分布(df = k - 1)。
整体 H 检验显著时,以 Dunn 检验进行事后两两比较,
采用 Bonferroni 方法校正多重比较。效应量报告 epsilon^2(epsilon^2 = (H - k + 1)/(N - k)),
参照 Cohen(1988)eta^2 标准(.01/.06/.14 分别对应小中大效应)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。

七、在 ChatSRS 一句话获得规范非参数检验报告

打开 chatsrs.com,上传数据后输入:

"对两组(实验组 vs 对照组)的疼痛评分做 Mann-Whitney U 检验,数据不满足正态性假设;输出 U 值、Z 近似值、精确 p 值、效应量 r,并给出符合 APA 7th 格式的完整报告段落,包含各组中位数和四分位距。"

或针对三组比较:

"对三种教学方法(A/B/C)的考试成绩做 Kruskal-Wallis H 检验,整体显著时用 Dunn 检验做事后两两比较(Bonferroni 校正);输出 H 值、df、p 值、epsilon^2 效应量,并附符合 APA 7th 格式的结果段落,包含各组 Mdn 和 IQR。"

ChatSRS 的输出段落即为上文模板格式,数值自动填入,R 引擎保证精确 p 值(不依赖大样本近似),可直接复制进论文。


八、非参数检验报告常见错误对照表

常见错误正确写法违反的规则
非参数检验仍报告 M 和 SD应报告 Mdn 和 IQR非参数用中位数描述集中趋势
无效应量r = .XX 或 epsilon^2 = .XXAPA 7th 要求所有推断统计报告效应量
p = 0.032p = .032APA 不加前导零
p = .000p < .001.000 是舍入假值
H(2)括号内写总人数H(df) = H(k-1),df 是组数减一df 是自由度不是样本量
未说明选用非参数检验的理由方法章节说明正态性检验结果APA 要求说明假设检验依据
Kruskal-Wallis 显著后无事后比较补充 Dunn 检验结果整体显著必须定位差异所在
Wilcoxon W 和 Z 混用不说明明确写"W = XX(精确)"或"Z = XX(近似)"统计量含义不同须说明
效应量 r 计算用错 Nr = Z/√N,N 为有效配对数/总样本量去除差值为 0 的配对后的 N

常见 FAQ

Q:非参数检验可以报告均值 M 吗,还是必须报告中位数 Mdn?

A:原则上应报告中位数 Mdn 和四分位距 IQR,而非均值 M 和标准差 SD。选用非参数检验的前提是数据不满足正态假设(通常是偏态或序数数据),此时均值不代表典型值,中位数更能反映数据的中心趋势。APA 7th 的报告原则是"所报描述统计应与检验方法的前提假设相符"。如果你同时希望报告均值(例如为了方便与其他研究比较),可以写:"中位数 Mdn = XX,IQR = XX(均值 M = XX,SD = XX,仅供参考)",但核心效应判断应基于中位数。

Q:Mann-Whitney U 和 Wilcoxon 秩和检验是同一个检验吗?

A:本质上是等价的。Mann-Whitney U 检验和 Wilcoxon 秩和检验(Wilcoxon Rank-Sum Test,注意区别于 Wilcoxon 符号秩检验)对两独立样本的检验在数学上完全等价,只是统计量的形式不同(U 和 W/T 可以互相转换)。在论文中任选一种称呼并保持一致即可;SPSS 默认输出 Mann-Whitney U,R 的 wilcox.test() 对独立样本默认输出 W。若审稿人指定称呼,以期刊要求为准。

Q:Kruskal-Wallis H 值超过了 chi^2 临界值,但 p = .052 没显著,该怎么解释?

A:p = .052 大于 alpha = .05,按传统阈值结论是"差异未达统计显著",但这并不意味着没有实质意义。正确做法是:(1) 报告 H 值和精确 p 值(p = .052,不要写"p 接近显著"这类非规范表述);(2) 报告效应量 eta^2_H,如果效应量在中等及以上,说明"存在具有实践意义的差异,但当前样本量可能不足以达到统计显著";(3) 可以补充事后功效分析(post-hoc power)说明检验功效;(4) 如果期刊允许,可以在讨论中指出这是探索性发现,建议后续研究增大样本量。绝对不能因为 p = .052 就改变分析方法或删除数据。

Q:同一份数据,我既做了 t 检验(p = .03),又做了 Mann-Whitney U 检验(p = .06),两者结论不一致怎么办?

A:这是很常见的情况,因为两者的检验功效不同。正确做法是:在研究设计阶段就决定使用哪种检验,不能事后择优汇报。如果数据满足正态性假设,t 检验是首选;如果不满足,Mann-Whitney U 是正确选择,此时 p = .06 才是应该报告的结果。"跑了两种检验,选显著的报告"是 p-hacking,会导致论文被拒或撤稿。方法章节应预先说明检验选择依据(正态性检验结果),结果与方法保持一致。

Q:非参数检验的效应量 r 怎么判断大小,和相关系数 r 是一样的标准吗?

A:非参数检验效应量 r(= Z/√N)的判断标准与相关系数的 Cohen 标准相同(.10 = 小,.30 = 中,.50 = 大),但两者含义不同:这里的 r 不是 Pearson 相关系数,而是通过标准化统计量换算的效应大小估计,反映的是"两组分布差异的标准化大小"。在引用时建议写明出处:"参照 Cohen(1992)效应量大小标准"。另外,有些研究者会把 Kruskal-Wallis 的效应量写作 epsilon^2 而非 eta^2_H(两者计算略有不同),选哪个应与所用统计软件的默认输出一致,并在方法章节说明。


快速参考:非参数检验格式速查卡

[Mann-Whitney U — 两独立样本]
各组: Mdn = XX, IQR = XX
U = X.XX [, Z = X.XX], p [= .XXX / < .001], r = .XX
r = Z / sqrt(N_total)

[Kruskal-Wallis H — 三组及以上独立样本]
各组: Mdn = XX, IQR = XX
H([k-1]) = X.XX, p [= .XXX / < .001], epsilon^2 = .XX
epsilon^2 = (H - k + 1) / (N - k)
事后: Dunn 检验 + Bonferroni 校正

[Wilcoxon 符号秩 — 配对/前后测]
前: Mdn = XX, IQR = XX;后: Mdn = XX, IQR = XX
小样本 (n <= 25): W = XX, p = .XXX, r = .XX
大样本 (n > 25): Z = X.XX, p [= .XXX / < .001], r = .XX
r = Z / sqrt(N_valid_pairs)

[描述统计格式注意事项]
- 非参数检验用 Mdn(中位数)不用 M(均值)
- 用 IQR(四分位距)不用 SD(标准差)
- p 不加前导零:.032 而非 0.032
- p = .000 改写为 p < .001

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。