教程 ·

p 值不是万能的,为什么论文越来越强调效应量

p<0.05就代表结果重要吗?本文讲清楚p值和效应量(Cohen's d、eta方、r等)的本质区别,为什么顶级期刊越来越要求同时报告效应量,以及在论文里该怎么正确解读和呈现两者。

"p<0.001,结果非常显著"——这句话在很多论文的结果部分随处可见,但它其实只回答了一半的问题:这个差异是不是真实存在的?至于这个差异到底有多大、有没有实际意义,p 值本身并不能告诉你。这正是效应量(effect size)存在的意义。


p 值到底在回答什么问题

p 值的严格定义是:在原假设为真的前提下,观察到当前数据(或更极端情况)的概率。它回答的是"这个差异是不是偶然出现的",本质上是一个关于统计显著性的判断。

p 值有两个常被忽视的特性:

  • 样本量会直接影响 p 值的大小:同样的效应大小,样本量越大,p 值越容易达到显著(p<0.05)。这意味着一个样本量足够大的研究,哪怕两组只相差 0.01 分(几乎没有实际意义),也可能得出"差异显著"的结论。
  • p 值不告诉你差异有多大:p=0.001 和 p=0.04 都表示"显著",但你无法从 p 值本身判断哪个差异在实际意义上更大——因为 p 值同时受效应大小和样本量两个因素影响,无法单独拆解出"效应有多大"这个信息。

这就是为什么单独报告 p 值容易产生误导:一个统计显著但效应量极小的结果,在实际应用中可能毫无意义。


效应量在回答什么问题

效应量衡量的是差异或关系的实际大小,不受样本量直接影响(这是效应量与 p 值最本质的区别)。常见效应量指标:

分析类型常用效应量指标解读参考(Cohen 经验标准)
两组均值比较(t 检验)Cohen's d0.2=小, 0.5=中, 0.8=大
多组均值比较(方差分析)eta方(η²)/ partial η²0.01=小, 0.06=中, 0.14=大
相关分析相关系数 r0.1=小, 0.3=中, 0.5=大
回归分析R²(解释方差比例)依研究领域而异,无统一经验标准
卡方检验(分类变量关联)Cramér's V / Phi 系数依自由度不同标准不同

效应量的关键价值在于:它是一个不随样本量变化而系统性膨胀的指标,两个不同样本量的研究,如果效应量接近,说明现象背后的实际强度是可比的——这也是为什么效应量是元分析(meta-analysis)能够跨研究整合结果的基础。


一个具体的例子说明两者的差异

假设有两个研究都比较了实验组和对照组的某项测试得分:

  • 研究 A:每组 20 人,均值相差 5 分,标准差 5 分,Cohen's d = 1.0(大效应),但由于样本量小,p = 0.08(不显著)
  • 研究 B:每组 2000 人,均值相差 0.5 分,标准差 5 分,Cohen's d = 0.1(极小效应),p < 0.001(高度显著)

如果只看 p 值,研究 B 看起来"结果更有力";但从效应量看,研究 A 揭示的现象强度是研究 B 的 10 倍,只是样本量不够、统计功效不足以达到显著。这正是为什么单独依赖 p 值排序研究的"重要性"是有问题的。


为什么期刊越来越强调效应量

这背后有一段学术界的反思历程:2010 年代起,心理学、医学等领域经历了"可重复性危机"(replication crisis),大量声称"显著"的研究结果无法在重复实验中复现。事后分析发现,很多研究存在"p-hacking"(不断调整分析方式直到得出 p<0.05)的问题,而效应量小、样本量刚好卡在能显著的临界点,正是这类问题的典型特征。

因此,美国心理学会(APA)在第六版、第七版格式手册中都明确要求:报告统计检验结果时必须同时报告效应量,很多期刊的审稿要求也随之收紧,只报告 p 值而不报告效应量的稿件,常常会被要求补充修改。


论文里怎么正确报告

规范的报告方式是同时呈现两者,且措辞上要区分"统计显著"和"实际重要":

独立样本 t 检验结果显示,实验组得分(M=78.3, SD=6.2)显著高于对照组(M=72.1, SD=5.9),t(98)=4.86, p<.001,Cohen's d=0.97,效应量达到大效应标准,说明该差异不仅具有统计显著性,实际影响幅度也较大。

如果效应量很小但统计显著(大样本常见情况),诚实的写法是明确指出这一点,而不是回避:

虽然差异在统计上显著(p<.001),但效应量较小(d=0.08),提示该差异的实际意义有限,可能主要归因于样本量较大带来的统计功效提升。

这种"既报告显著性、又诚实讨论效应量大小"的写法,在审稿人眼中通常比单纯堆砌"p<0.001"更有说服力。


用 ChatSRS 怎么做

效应量的计算公式因分析类型而异(Cohen's d 的分母该用哪个标准差、eta方和 partial eta方该怎么选),手动算很容易出错。用 ChatSRS 时,效应量是标准输出的一部分,不需要额外要求:

"帮我对这两组数据做独立样本 t 检验。"

AI 会在三线表和文字解读中同时给出 t 值、p 值和 Cohen's d,并在解读段落里说明效应量对应的大小等级,不需要你事后自己补算。


常见 FAQ

Q:效应量小是不是说明研究没有价值?

A:不一定。有些领域(比如公共卫生政策、大规模行为经济学干预)本身效应量普遍偏小,但因为影响人群基数巨大,小效应量依然有很大的实际价值(比如某个提醒机制让疫苗接种率提高 1 个百分点,在全国范围内也是巨大的公共卫生收益)。效应量的大小需要结合具体研究领域的常见范围来判断,不能脱离领域背景照搬 Cohen 的通用经验标准。

Q:如果 p 值不显著,但效应量不小,该怎么写?

A:这种情况通常出现在样本量不足、统计功效(power)较低时。诚实的写法是报告实际的效应量和置信区间,说明"虽然本研究样本量下未达到统计显著,但观察到的效应量为中等/较大,提示该效应可能真实存在,未来研究可通过扩大样本量进一步验证",同时避免过度解读不显著的结果为"证明了没有差异"(不显著不等于零效应)。

Q:所有效应量指标之间可以互相换算吗?

A:部分可以,比如 Cohen's d 与相关系数 r 之间存在换算公式,但换算前提是数据结构和分析假设匹配,跨分析类型的效应量(比如把方差分析的 eta方直接类比回归的 R²)需要谨慎,最稳妥的做法是直接报告该分析类型对应的标准效应量指标,而不是强行换算成另一种指标。


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内【用户中心 -> 帮助与反馈】联系我们。