教程 ·

显著的那一行反而最不该写进论文——分组变量和结果变量是同一件事

p<0.001、效应量超过大效应标准,产品自己却把这一行按住了。实测演示非参数检验里"显著但同义反复"怎么识别,以及不显著那一行为什么才是真结论。演示数据 N=291。

这份数据里最显著的那一行,恰恰是最不该当成发现的一行。 p<0.001、效应量大到超过参考标准,产品自己却在结论里把它按住了——因为那个分组本来就是按结果变量切出来的。看懂它为什么按住,比看懂 p 值有用得多。

这一页解决什么

这篇不讲非参数检验怎么跑,也不重复非参数检验完整教程里的"输出结果怎么读"。本文只解决一个判断:一张表里有显著和不显著两行时,哪一行是真结论、哪一行只能进数据描述。

演示数据(不是真实论文数据,模拟问卷,清洗后有效样本 291 份)。比的变量是"每周使用 AI 工具的小时数",一次按使用频率分低频、中频、高频三组,一次按性别分男女两组。怎么让它跑出来见数据不正态的组间比较该走哪条路,这一篇只逐行读这两张表。

先看这张表跟你熟悉的那种不一样在哪

它报的不是均值±标准差,是 M(P25,P75)。 把所有人按小时数从小到大排队,站在正中间那位的数值就是 M(中位数),排在四分之一处和四分之三处的那两位是 P25、P75。为什么换成中位数?因为这个变量本来就有几个极端值,均值会被它们拽走,中位数不会。

每周使用AI工具的小时数 M(P25,P75)
A.中频(n=84)5.000(3.350, 8.225)
B.低频(n=95)2.600(1.700, 4.000)
C.高频(n=112)8.500(5.675, 11.725)

数据来源:ChatSRS 实测输出的 Kruskal-Wallis H 检验表,演示数据 N=291,非真实论文数据。

ChatSRS 输出的 Kruskal-Wallis H 检验表,三组中位数与四分位数、H 值、p 值、效应量 η² 逐列列出 Kruskal-Wallis H 检验表:三组的 n 全写在表头里,M(P25,P75) 这个格式也只有表头能证明,η² 那一列是效应量。

显著的那一行:H(2)=112.702,p<0.001

效应量 η²=0.389。产品的读法是「效应量 η²=0.389,超过大效应量参考标准,说明使用频率分组与每周使用时长之间的差异幅度较大。」——单看这一句,已经是能写进摘要的分量了。

但它紧接着加了一句没被要求的话:「该结果符合分组变量与小时数之间的定义关系,但不宜将其理解为独立的因果发现。」收尾时又补了一遍:「频率分组与使用时长本身具有直接的概念关联,因此三组检验结果主要用于验证数据分组的一致性。」

翻成大白话:低频、中频、高频这个分组,本来就是按"用得多不多"分出来的;再回头去证明"高频组的使用小时数更高",等于拿一件事去证明它自己。数字再漂亮也不是发现。答辩和审稿最爱挑的就是这一类:分组变量和结果变量其实是同一件事的两种写法。

产品输出的三处解读原文,含 η²=0.389 的效应量判断、定义关系提醒与 r=0.007 的结论 产品的解读原文:效应量那句、"不宜将其理解为独立的因果发现"那句、以及性别那一行几乎没有实际关联的判断,三处都在同一段输出里。

不显著的那一行:U=10291.000,p=0.906

性别两组:z=0.119,效应量 r=0.007。它的判断写的是「效应量 r=0.007,远低于小效应量标准,表明性别与每周使用 AI 工具时长之间几乎没有实际关联。」

注意它是拿效应量说话,不是只看 p 值。 p=0.906 说的是"这份数据没能证明两组不一样";r=0.007 说的是"就算有差别,也小到没有实际意义"。这是两个层次的话,能同时给出来,比只甩一个 p 值硬得多。("效应量"就是差距有多大,跟"差距是不是碰巧"是两回事——两组比较看 r,三组及以上看 η²。)

ChatSRS 输出的 Mann-Whitney U 检验表,男女两组中位数与四分位数、U、z、p、效应量 r Mann-Whitney U 检验表:女 n=173、男 n=118,两组中位数接近,U、z、p 与效应量 r 逐列可读。

两行放一起:哪一行进结论,哪一行进数据描述

三组比较(使用频率分组)两组比较(性别)
用的检验Kruskal-Wallis H 检验Mann-Whitney U 检验
统计量H(2)=112.702U=10291.000,z=0.119
p 值<0.0010.906
效应量η²=0.389r=0.007
产品的判断「超过大效应量参考标准」,但「不宜将其理解为独立的因果发现」「远低于小效应量标准……几乎没有实际关联」
论文里该放哪数据描述,用来说明分组划得对才是真正的一句结论

数据来源:ChatSRS 实测输出,演示数据 N=291,非真实论文数据;表中引号内为产品原话。

三组那一行应该放进数据描述,用来说明分组划得对性别那一行才是真正的一句结论——在本样本中,性别不解释使用时长的差异。这句话没有 p<0.001 好看,但它是干净的。显著不等于有信息量,这是非参数检验最容易翻车的地方。

什么情况下不适用

  • 这是模拟数据(N=291,非真实论文数据),上面任何结论都说明不了真实情况。
  • 不显著的结果要不要留在正文,不同学科和期刊要求不一样,这个得问导师。
  • "没能证明两组不一样"不等于"两组一样",p=0.906 只能写成前者。
  • 本文只讲怎么判断哪一行值得写,具体的 U 值、z 统计量、效应量 r 该按什么格式落进论文,见 Mann-Whitney U 检验的 APA 报告怎么写
  • AI 给的判断也建议自己再核一遍。

常见问题

p<0.001 的结果,为什么反而不该写进结论?

因为分组变量可能和结果变量本来就是同一件事。本文实测里,低频/中频/高频这个分组是按使用时长切出来的,再去检验"三组的使用时长不同",等于拿一件事证明它自己。产品自己的措辞是「不宜将其理解为独立的因果发现」。

怎么判断一个分组变量是不是和结果变量重复了?

看这个分组当初是怎么划出来的。如果分组的依据就是结果变量本身(或它的直接换算),那检验一定显著,而且显著本身不带信息。这类分组的结果适合放在数据描述里,用来说明分组划分是一致的。

不显著的结果,论文里还有没有必要写?

本文实测那一行是有信息量的:p=0.906 加上 r=0.007,两个层次合起来说的是"在本样本中,性别不解释使用时长的差异"。注意措辞只能写成"没能证明两组不一样",不能写成"证明男女相同"。是否保留在正文,不同学科和期刊要求不一样。

效应量和 p 值该先看哪个?

两个都要看,而且顺序是先统计量和 p、再效应量。本文实测两行正好演示了两种情况:一行是 p 极小但效应量的意义要打折扣,另一行是 p 不显著且效应量也极小。只看其中一个都会得出片面结论。

非参数检验的结果该按什么顺序读?

按"中位数和四分位数 → 检验统计量和 p → 效应量 → 这个分组是不是跟结果变量重复了"这个顺序读。前三步在非参数检验完整教程里有完整对照,第四步就是本文讲的这件事。

按这个顺序读一遍你自己的表

数据去标识之后,可以登录 ChatSRS 开始分析。拿到非参数结果后,先按中位数、统计量、效应量三步读完,最后专门问自己一句:这个分组,是不是和我要比的那个指标本来就是同一件事。

相关文章推荐


本文演示数据为模拟问卷(清洗后有效样本 291 份),非真实论文数据。具体功能、数据处理规则和价格以当前产品页面与真实输出为准。