统计百科 ·
非参数检验APA报告怎么写 — Mann-Whitney U / Kruskal-Wallis H / Wilcoxon W 格式全解
统计百科:专攻非参数检验APA 7th报告格式——Mann-Whitney U值、Kruskal-Wallis H值、Wilcoxon W值的完整写法,中位数怎么报告、效应量r如何计算与呈现,给出可直接套用进论文的APA报告模板,并盘点最常见的格式错误。
非参数检验是参数检验"跑不下去"时的必选项:数据严重偏态、样本量太小、测量层次只到序数……但很多研究者拿到结果后反而更迷茫——U 值、H 值、W 值到底怎么写进论文?中位数要不要报告、效应量用哪个指标、APA 7th 对这些检验有没有特殊要求?这篇文章给出全部答案,并附上可直接复制进方法章节和结果章节的完整模板。
你的非参数检验报告有这些问题吗?
导师或审稿人关于非参数检验报告最常见的反馈:
- "Mann-Whitney U 要报告两个组的中位数,只写 U 值没有描述统计"
- "效应量在哪里?非参数检验也要报告 r 或 eta^2"
- "Wilcoxon 符号秩检验的统计量是 W 还是 Z?两者都要报告吗"
- "Kruskal-Wallis 显著了,但事后比较方法是什么?用 Dunn 还是 Bonferroni"
- "样本量 N 写的是总人数还是各组人数?"
- "p < .05 写对了,但 APA 不加前导零——你写的是 p = 0.032"
这些问题集中在 APA Publication Manual 第七版关于推断统计报告、描述统计以及效应量报告的多个规定上,而市面上针对非参数检验格式的汇总资料极少。本文只讲一件事:非参数检验统计量如何规范写进论文的每一种场景。
如果你还没看过姊妹篇 t 值的 APA 7th 报告写法 和 F 值的 APA 7th 报告写法,建议先读那两篇,本文默认你已了解 p 值不加前导零(.032 而非 0.032)等基础格式规则,不再重复。
一、什么时候应该用非参数检验
非参数检验的四个适用场景
非参数检验(Non-parametric tests)不依赖"总体服从正态分布"的假设,适用于:
| 场景 | 对应参数检验 | 对应非参数检验 |
|---|---|---|
| 两独立样本比较,数据非正态或序数 | 独立样本 t 检验 | Mann-Whitney U 检验 |
| 三组及以上独立样本比较 | 单因素 ANOVA | Kruskal-Wallis H 检验 |
| 配对/同一被试两次测量比较 | 配对样本 t 检验 | Wilcoxon 符号秩检验 |
| 三个及以上相关测量比较 | 重复测量 ANOVA | Friedman 检验 |
非正态的判断依据
选择非参数检验前,方法章节应说明正态性检验结果:
- Shapiro-Wilk 检验(推荐,N < 50 时尤其适合):W = .XXX,p = .XXX
- Kolmogorov-Smirnov 检验(大样本):D(N) = .XXX,p = .XXX
- 或陈述"数据呈明显正偏态(偏度 = X.XX)/存在显著异常值,不满足参数检验的正态性假设,故采用非参数方法"
二、APA 7th 非参数检验报告通用要素
无论哪种非参数检验,APA 7th 要求报告以下要素:
| 要素 | 格式说明 |
|---|---|
| 检验统计量 | U / H / W,精确到两位小数(整数则不加小数点) |
| 样本量 | 各组 n,或总 N |
| p 值 | 精确三位小数;p < .001 时写 p < .001 |
| 效应量 | r(常用)或 epsilon^2(Kruskal-Wallis) |
| 描述统计 | 中位数 Mdn 和四分位距 IQR(不是均值 M) |
关键点:非参数检验用**中位数(Mdn)而非均值(M)来描述集中趋势,用四分位距(IQR)**而非标准差(SD)来描述离散程度,这与参数检验有本质区别。
三、Mann-Whitney U 检验:两独立样本非参数比较
U 值是什么
Mann-Whitney U 检验比较两组序数或非正态连续数据的分布是否有差异。其统计量 U 等于"第一组每个观测值大于第二组每个观测值的对数"。
$U_1 = n_1 n_2 + \frac{n_1(n_1+1)}{2} - R_1$
其中 $R_1$ 是第一组所有观测值的秩之和。通常报告两个 U 值中较小的那个(有些软件直接输出 Z 近似值,两者均可报告)。
APA 报告格式:Mann-Whitney U
必报要素:
Mann-Whitney U([n1, n2 或省略]) = X.XX, p = .XXX, r = .XX
附:各组 Mdn 和 IQR
APA 7th 对 Mann-Whitney U 的括号内自由度并无强制要求——若软件不输出可省略,保留 U 值和 p 值即可。效应量 r 的计算为:
$r = \frac{Z}{\sqrt{N}}$
其中 Z 是 Mann-Whitney 检验的标准化统计量,N 是总样本量(= n1 + n2)。
效应量大小判断标准(Cohen, 1992):
| 大小 | r 值 |
|---|---|
| 小效应 | .10 |
| 中效应 | .30 |
| 大效应 | .50 |
完整报告模板(Mann-Whitney U)
Mann-Whitney U 检验结果显示,[组1](Mdn = XX, IQR = XX)与[组2]
(Mdn = XX, IQR = XX)在[因变量]上的差异[显著/未达显著],
U = X.XX, p [= .XXX / < .001], r = .XX([大小]效应)。
填入数值的示例:
Mann-Whitney U 检验结果显示,实验组(Mdn = 78.00,IQR = 14.50)在疼痛评分上显著低于对照组(Mdn = 62.00,IQR = 19.00),U = 312.00,p = .003,r = .41,为中大效应。
报告 Z 近似值的变体格式
当样本量较大(通常 n > 20),软件会使用正态近似输出 Z 值,此时格式为:
Mann-Whitney U = X.XX, Z = X.XX, p [值], r = .XX
示例:
Mann-Whitney U = 3182.00,Z = -3.47,p < .001,r = .34,为中效应,表明女性被试(Mdn = 52,IQR = 18)在焦虑量表得分上显著高于男性被试(Mdn = 44,IQR = 15)。
四、Kruskal-Wallis H 检验:三组及以上独立样本非参数比较
H 值是什么
Kruskal-Wallis H 检验是单因素 ANOVA 的非参数替代,检验三组及以上独立样本的分布是否相同。H 统计量近似服从 chi^2 分布,自由度 df = k - 1(k 为组数)。
$H = \frac{12}{N(N+1)}\sum_{j=1}^{k}\frac{R_j^2}{n_j} - 3(N+1)$
APA 报告格式:Kruskal-Wallis H
必报要素:
H([df]) = X.XX, p = .XXX, epsilon^2 = .XX
附:各组 Mdn 和 IQR,若整体显著则加事后比较
效应量 epsilon^2(Kruskal-Wallis 专用;注:此式为 Tomczak & Tomczak (2014) 定义的 epsilon-squared,与严格意义上的 eta^2_H 分母不同,部分软件及文献将其标注为 eta^2_H,本文统一采用 epsilon^2):
$\epsilon^2 = \frac{H - k + 1}{N - k}$
效应量大小标准(同 ANOVA 的 eta^2):
| 大小 | epsilon^2 |
|---|---|
| 小效应 | .01 |
| 中效应 | .06 |
| 大效应 | .14 |
完整报告模板(Kruskal-Wallis H)
Kruskal-Wallis H 检验结果显示,[自变量]对[因变量]的效应[显著/不显著],
H([k-1]) = X.XX, p [= .XXX / < .001], epsilon^2 = .XX([大小]效应)。
各组描述统计:[组1]Mdn = XX, IQR = XX;[组2]Mdn = XX, IQR = XX;
[组3]Mdn = XX, IQR = XX。
Dunn 事后多重比较(Bonferroni 校正)显示,[显著组对描述];
[不显著组对描述](均 p > .05)。
填入数值的示例:
Kruskal-Wallis H 检验结果显示,三种干预方式(认知行为/正念/对照)对抑郁症状改善分的效应显著,H(2) = 14.32,p < .001,epsilon^2 = .142,为大效应。各组描述统计:认知行为组 Mdn = 12.00,IQR = 7.50;正念组 Mdn = 10.00,IQR = 6.00;对照组 Mdn = 5.00,IQR = 8.00。Dunn 事后多重比较(Bonferroni 校正)显示,认知行为组显著优于对照组(p = .001);正念组亦显著优于对照组(p = .008);认知行为组与正念组之间差异未达显著(p = .214)。
Kruskal-Wallis 的事后比较怎么写
H 检验整体显著后,需要进行事后两两比较,常用方法:
| 方法 | 适用场景 | 校正方式 |
|---|---|---|
| Dunn 检验(推荐) | 组数 3-6,是最常见的选择 | Bonferroni 或 Benjamini-Hochberg |
| Conover-Iman 检验 | 组间方差相近 | Bonferroni |
| Mann-Whitney U(简单粗暴) | 只有 3 组时有时用 | 手动 Bonferroni(alpha / 比较次数) |
方法章节说明:
Kruskal-Wallis 检验显著时,以 Dunn 检验进行事后两两比较,
并采用 Bonferroni 方法校正多重比较(调整后显著性水平 alpha = .05/[比较次数])。
五、Wilcoxon 符号秩检验:配对/重复测量非参数比较
W 值与 Z 值的关系
Wilcoxon 符号秩检验(Wilcoxon Signed-Rank Test)是配对样本 t 检验的非参数替代,适用于配对数据不满足正态性假设时。
统计量 W(或 T)等于正秩之和(或负秩之和中较小的那个)。当样本量较大时(n > 25),W 近似服从正态分布,软件会同时输出 Z 近似值。
两者均可报告,但若只报告其一:
- 小样本(n <= 25):报告 W(精确检验)
- 大样本(n > 25):报告 Z 近似值更稳健,同时也可附上 W
APA 报告格式:Wilcoxon 符号秩检验
效应量 r(同 Mann-Whitney,用 Z 近似值计算):
$r = \frac{Z}{\sqrt{N}}$
注意:此处 N = 有效配对数(不包含差值为 0 的配对)。
完整报告模板(Wilcoxon 符号秩检验)
Wilcoxon 符号秩检验结果显示,[前测](Mdn = XX, IQR = XX)与
[后测](Mdn = XX, IQR = XX)之间的差异[显著/不显著],
W = X.XX(或 Z = X.XX), p [= .XXX / < .001], r = .XX([大小]效应)。
小样本示例(精确 W):
Wilcoxon 符号秩检验结果显示,干预后疼痛评分(Mdn = 3.00,IQR = 2.00)显著低于干预前(Mdn = 7.00,IQR = 3.00),W = 18.00,p = .012,r = .56,为大效应,表明干预措施有效降低了被试的疼痛感知。
大样本示例(Z 近似):
Wilcoxon 符号秩检验结果显示,使用 ChatSRS 后的分析效率评分(Mdn = 8.00,IQR = 2.00)显著高于使用前(Mdn = 5.00,IQR = 3.00),Z = -4.23,p < .001,r = .59,为大效应。
六、方法章节标准写法
报告选用非参数检验的依据
方法章节应明确说明使用非参数检验的原因,不能只写"使用了 Mann-Whitney U 检验"而不说为什么。标准写法:
数据正态性检验采用 Shapiro-Wilk 检验,结果显示[因变量]未满足正态性假设
(W = .XX, p = .XXX),因此采用 Mann-Whitney U 检验代替独立样本 t 检验
比较两组差异。效应量采用 r(r = Z/√N),参照 Cohen(1992)标准
(.10 = 小效应,.30 = 中效应,.50 = 大效应)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。
完整方法章节(Kruskal-Wallis 版本)
各组[因变量]均未通过 Shapiro-Wilk 正态性检验(所有 p < .05),
且各组样本量均小于 30,不满足参数检验条件,因此采用 Kruskal-Wallis H 检验
比较三组差异。检验统计量 H 近似服从 chi^2 分布(df = k - 1)。
整体 H 检验显著时,以 Dunn 检验进行事后两两比较,
采用 Bonferroni 方法校正多重比较。效应量报告 epsilon^2(epsilon^2 = (H - k + 1)/(N - k)),
参照 Cohen(1988)eta^2 标准(.01/.06/.14 分别对应小中大效应)。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。
七、在 ChatSRS 一句话获得规范非参数检验报告
打开 chatsrs.com,上传数据后输入:
"对两组(实验组 vs 对照组)的疼痛评分做 Mann-Whitney U 检验,数据不满足正态性假设;输出 U 值、Z 近似值、精确 p 值、效应量 r,并给出符合 APA 7th 格式的完整报告段落,包含各组中位数和四分位距。"
或针对三组比较:
"对三种教学方法(A/B/C)的考试成绩做 Kruskal-Wallis H 检验,整体显著时用 Dunn 检验做事后两两比较(Bonferroni 校正);输出 H 值、df、p 值、epsilon^2 效应量,并附符合 APA 7th 格式的结果段落,包含各组 Mdn 和 IQR。"
ChatSRS 的输出段落即为上文模板格式,数值自动填入,R 引擎保证精确 p 值(不依赖大样本近似),可直接复制进论文。
八、非参数检验报告常见错误对照表
| 常见错误 | 正确写法 | 违反的规则 |
|---|---|---|
| 非参数检验仍报告 M 和 SD | 应报告 Mdn 和 IQR | 非参数用中位数描述集中趋势 |
| 无效应量 | r = .XX 或 epsilon^2 = .XX | APA 7th 要求所有推断统计报告效应量 |
| p = 0.032 | p = .032 | APA 不加前导零 |
| p = .000 | p < .001 | .000 是舍入假值 |
| H(2)括号内写总人数 | H(df) = H(k-1),df 是组数减一 | df 是自由度不是样本量 |
| 未说明选用非参数检验的理由 | 方法章节说明正态性检验结果 | APA 要求说明假设检验依据 |
| Kruskal-Wallis 显著后无事后比较 | 补充 Dunn 检验结果 | 整体显著必须定位差异所在 |
| Wilcoxon W 和 Z 混用不说明 | 明确写"W = XX(精确)"或"Z = XX(近似)" | 统计量含义不同须说明 |
| 效应量 r 计算用错 N | r = Z/√N,N 为有效配对数/总样本量 | 去除差值为 0 的配对后的 N |
常见 FAQ
Q:非参数检验可以报告均值 M 吗,还是必须报告中位数 Mdn?
A:原则上应报告中位数 Mdn 和四分位距 IQR,而非均值 M 和标准差 SD。选用非参数检验的前提是数据不满足正态假设(通常是偏态或序数数据),此时均值不代表典型值,中位数更能反映数据的中心趋势。APA 7th 的报告原则是"所报描述统计应与检验方法的前提假设相符"。如果你同时希望报告均值(例如为了方便与其他研究比较),可以写:"中位数 Mdn = XX,IQR = XX(均值 M = XX,SD = XX,仅供参考)",但核心效应判断应基于中位数。
Q:Mann-Whitney U 和 Wilcoxon 秩和检验是同一个检验吗?
A:本质上是等价的。Mann-Whitney U 检验和 Wilcoxon 秩和检验(Wilcoxon Rank-Sum Test,注意区别于 Wilcoxon 符号秩检验)对两独立样本的检验在数学上完全等价,只是统计量的形式不同(U 和 W/T 可以互相转换)。在论文中任选一种称呼并保持一致即可;SPSS 默认输出 Mann-Whitney U,R 的 wilcox.test() 对独立样本默认输出 W。若审稿人指定称呼,以期刊要求为准。
Q:Kruskal-Wallis H 值超过了 chi^2 临界值,但 p = .052 没显著,该怎么解释?
A:p = .052 大于 alpha = .05,按传统阈值结论是"差异未达统计显著",但这并不意味着没有实质意义。正确做法是:(1) 报告 H 值和精确 p 值(p = .052,不要写"p 接近显著"这类非规范表述);(2) 报告效应量 eta^2_H,如果效应量在中等及以上,说明"存在具有实践意义的差异,但当前样本量可能不足以达到统计显著";(3) 可以补充事后功效分析(post-hoc power)说明检验功效;(4) 如果期刊允许,可以在讨论中指出这是探索性发现,建议后续研究增大样本量。绝对不能因为 p = .052 就改变分析方法或删除数据。
Q:同一份数据,我既做了 t 检验(p = .03),又做了 Mann-Whitney U 检验(p = .06),两者结论不一致怎么办?
A:这是很常见的情况,因为两者的检验功效不同。正确做法是:在研究设计阶段就决定使用哪种检验,不能事后择优汇报。如果数据满足正态性假设,t 检验是首选;如果不满足,Mann-Whitney U 是正确选择,此时 p = .06 才是应该报告的结果。"跑了两种检验,选显著的报告"是 p-hacking,会导致论文被拒或撤稿。方法章节应预先说明检验选择依据(正态性检验结果),结果与方法保持一致。
Q:非参数检验的效应量 r 怎么判断大小,和相关系数 r 是一样的标准吗?
A:非参数检验效应量 r(= Z/√N)的判断标准与相关系数的 Cohen 标准相同(.10 = 小,.30 = 中,.50 = 大),但两者含义不同:这里的 r 不是 Pearson 相关系数,而是通过标准化统计量换算的效应大小估计,反映的是"两组分布差异的标准化大小"。在引用时建议写明出处:"参照 Cohen(1992)效应量大小标准"。另外,有些研究者会把 Kruskal-Wallis 的效应量写作 epsilon^2 而非 eta^2_H(两者计算略有不同),选哪个应与所用统计软件的默认输出一致,并在方法章节说明。
快速参考:非参数检验格式速查卡
[Mann-Whitney U — 两独立样本]
各组: Mdn = XX, IQR = XX
U = X.XX [, Z = X.XX], p [= .XXX / < .001], r = .XX
r = Z / sqrt(N_total)
[Kruskal-Wallis H — 三组及以上独立样本]
各组: Mdn = XX, IQR = XX
H([k-1]) = X.XX, p [= .XXX / < .001], epsilon^2 = .XX
epsilon^2 = (H - k + 1) / (N - k)
事后: Dunn 检验 + Bonferroni 校正
[Wilcoxon 符号秩 — 配对/前后测]
前: Mdn = XX, IQR = XX;后: Mdn = XX, IQR = XX
小样本 (n <= 25): W = XX, p = .XXX, r = .XX
大样本 (n > 25): Z = X.XX, p [= .XXX / < .001], r = .XX
r = Z / sqrt(N_valid_pairs)
[描述统计格式注意事项]
- 非参数检验用 Mdn(中位数)不用 M(均值)
- 用 IQR(四分位距)不用 SD(标准差)
- p 不加前导零:.032 而非 0.032
- p = .000 改写为 p < .001
相关阅读
- 非参数检验 AI 实操教程 — Mann-Whitney/Kruskal-Wallis/Wilcoxon 全流程
- t 值的 APA 7th 报告写法 — 自由度、效应量、独立/配对模板全解
- APA 7th 效应量报告指南 — Cohen d、r、eta 平方完整格式
- 统计显著性与 P 值完全指南
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。