统计百科 ·

Sobel检验还是Bootstrap?中介效应显著性检验怎么选

统计百科:深入对比Sobel检验与Bootstrap两种中介效应显著性检验方法——正态分布假设差异、小样本表现、APA 7th报告格式区别,给出可直接套用的论文报告模板,帮你选对方法、写对格式。

中介效应分析里,"间接效应显不显著"这个问题有两套主流解法:经典的Sobel检验和现代的Bootstrap法。两者给出的结论有时一致,有时却截然相反——你用Sobel检验说"不显著(p = .067)",导师或审稿人偏偏要求"跑Bootstrap",结果95% CI不含0,反而显著了。到底哪个对?为什么会不一样?这篇文章从统计原理出发,给出清晰的选用逻辑,并附APA 7th可套用的报告句式。


你遇到过这些困惑吗?

  • 用Sobel检验,p = .067,间接效应"不显著";换Bootstrap,95% CI = [0.02, 0.34],"又显著了",哪个可信?
  • 论文方法章节该写"采用Sobel检验"还是"采用Bootstrap法"?
  • 审稿人要求"报告Bootstrap置信区间",Sobel的p值不够用吗?
  • 样本量只有80人,还能用Sobel检验吗?
  • 偏差校正Bootstrap(BC Bootstrap)和百分位Bootstrap有什么区别?

这些问题的核心分歧只有一个:Sobel检验假设间接效应的抽样分布是正态的,Bootstrap不做这个假设。理解了这一点,选哪种方法就清楚了。

如果你对中介效应的基本概念和APA报告格式还不熟悉,建议先读姊妹篇 中介效应APA报告怎么写?,本文默认你已了解a路径、b路径和间接效应 a×b 的含义。


一、中介效应的间接效应是什么

在经典三变量中介模型中:

$X \xrightarrow{a} M \xrightarrow{b} Y$

间接效应 = a × b,即自变量X经由中介变量M影响因变量Y的那部分效应。

显著性检验的核心问题:间接效应 a×b 是否显著不同于零?

这看起来简单,但有一个统计难题:a×b是两个随机变量的乘积,其抽样分布通常不是正态分布,尤其在:

  • 样本量较小时(N < 200)
  • a、b路径系数本身不显著时
  • 两个路径系数中有一个接近零时

正是这个乘积分布的非正态性,导致了Sobel检验和Bootstrap在小样本或弱效应情境下的分歧。


二、Sobel检验:经典但有局限

原理

Sobel检验(Sobel, 1982)将间接效应的标准误估计为:

$SE_{ab} = \sqrt{b^2 \cdot SE_a^2 + a^2 \cdot SE_b^2}$

然后用 $z = \frac{a \times b}{SE_{ab}}$ 计算z统计量,与标准正态分布比较,得出p值。

核心假设

Sobel检验假设间接效应 a×b 的抽样分布近似正态。这个假设在以下条件下成立:

  • 样本量足够大(通常要求 N > 200,偏保守的文献要求 N > 500)
  • a路径和b路径均较强且显著
  • 总体中真实效应不极端(非极度偏态)

问题所在

a×b乘积的分布几乎从不是正态的。即使a和b各自服从正态,它们的乘积分布也是有偏的(skewed),在小样本或弱路径系数的情境下尤为明显(MacKinnon, Lockwood, & Williams, 2004)。

后果:Sobel检验存在系统性功效损失——它本来就比Bootstrap保守,更容易出现假阴性(真实存在中介效应但被判为不显著)。这不是"两种方法都对",而是Sobel检验在方法论上有已知的局限。

Sobel检验适用场景

尽管如此,Sobel检验在以下情形仍有一定参考价值:

条件是否适用Sobel
N > 1000,大样本勉强可用(分布趋近正态)
仅做探索性分析,不发表可作为初步参考
旧期刊/早年研究复现保留Sobel以便对比
主要结果报告不推荐,应用Bootstrap

三、Bootstrap:无分布假设的现代标准

原理

Bootstrap(Efron, 1979)是一种重抽样(resampling)方法:

  1. 从原始样本(N个观测)中有放回地随机抽取N个观测,构成一个"Bootstrap样本"
  2. 在该Bootstrap样本上重新估计路径系数,计算 a×b
  3. 重复上述过程B次(通常B = 5000次)
  4. 用这B个 a×b 值构建经验抽样分布
  5. 取该分布的2.5和97.5百分位数,构成95% Bootstrap置信区间(CI)

如果95% CI不含零,则间接效应显著(alpha = .05)

为什么Bootstrap更优

Bootstrap不对间接效应的分布做任何参数假设。它直接从数据中"经验性地"估计抽样分布,因此:

  • 对乘积分布的非正态性天然免疫
  • 在小样本(N = 50~200)下依然保持较好的Type I错误率控制
  • 统计功效系统性高于Sobel检验(MacKinnon et al., 2004; Preacher & Hayes, 2008)

MacKinnon等人(2004)的模拟研究(此后被引用数千次)明确结论:Bootstrap法在中介效应检验中的功效显著优于Sobel检验,且一类错误率(虚警率)控制更准确。

两种Bootstrap变体

方法中文名原理适用
Percentile Bootstrap百分位Bootstrap直接取经验分布的百分位数一般情形
BC Bootstrap偏差校正Bootstrap在百分位基础上校正抽样分布的偏差(bias)效应分布偏斜时
BCa Bootstrap偏差校正加速Bootstrap同时校正偏差(bias)和加速度(acceleration)效应分布极度偏斜时

实际操作中,**BC Bootstrap(Bias-Corrected Bootstrap)**是最常用的选择,Hayes(2018)的PROCESS宏默认使用BC Bootstrap。详见姊妹篇 Bootstrap中介效应CI怎么做?


四、Sobel vs Bootstrap核心对比

维度Sobel检验Bootstrap
分布假设假设 a×b 服从正态分布无参数分布假设
推断指标z统计量 + p值置信区间(CI)
小样本(N < 200)偏保守,功效损失大表现较稳健
大样本(N > 1000)与Bootstrap结论接近仍推荐
统计功效系统性低于Bootstrap更高
计算复杂度一步计算,极简需重抽样(软件自动完成)
现代期刊接受度降低(仅少数旧期刊)主流标准
APA 7th推荐未特别推荐推荐(Psychological Methods)
输出格式z = X.XX, p = .XXX95% CI [LL, UL]

结论:除非有特殊理由(如复现早期研究、期刊明确要求),现代研究应优先采用Bootstrap法


五、两种方法的APA 7th报告格式

Sobel检验报告模板(仅供对比/历史参考)

采用Sobel检验评估[M]在[X]对[Y]影响中的中介效应。
结果显示,间接效应a×b = X.XXX,SE = X.XXX,
z = X.XX,p = .XXX。
[间接效应显著/不显著](p [< / >] .05),[M]对[X]→[Y]路径
[起到/不起到]显著中介作用。

填入数值的示例

采用Sobel检验(Sobel, 1982)评估工作满意度(M)在自主性(X)对离职意向(Y)影响中的中介效应。结果显示,间接效应 a×b = −0.124,SE = 0.068,z = −1.82,p = .069。间接效应未达显著(p > .05),Sobel检验未支持工作满意度的中介作用。

Bootstrap报告模板(推荐)

方法章节

采用Bootstrap重抽样法(5000次)构建间接效应的95%偏差校正置信区间
(BC Bootstrap CI;Preacher & Hayes, 2008),
以评估[M]在[X]与[Y]关系中的中介效应。

结果章节

Bootstrap分析结果(5000次重抽样)显示,
[X]经由[M]对[Y]的间接效应为a×b = X.XXX(SE = X.XXX),
95% BC Bootstrap CI = [LL, UL],置信区间[不含/含]零,
间接效应[显著/不显著](Hayes, 2018)。

填入数值的示例

Bootstrap分析结果(5000次重抽样)显示,自主性经由工作满意度对离职意向的间接效应为 a×b = −0.124(SE = 0.063),95% BC Bootstrap CI = [−0.267, −0.014],置信区间不含零,间接效应显著(Hayes, 2018)。在控制间接效应后,自主性对离职意向的直接效应为 b = −0.187(SE = 0.074),95% CI = [−0.332, −0.042],亦达显著水平,表明工作满意度发挥部分中介作用。

同时报告Sobel和Bootstrap的情形

在需要与历史文献对比、或期刊要求提供多种检验结果时,可同时报告两种方法:

以Sobel检验为参照(z = −1.82,p = .069,未达显著),同时采用Bootstrap重抽样法(5000次,BC校正)构建95% CI,间接效应 a×b = −0.124,95% CI = [−0.267, −0.014],置信区间不含零,Bootstrap结果支持中介效应显著。两种方法结论不一致,源于Sobel检验对乘积分布正态性的假设在本样本中(N = 89)可能不成立,Bootstrap结果为主要参照(MacKinnon et al., 2004)。


六、为什么两种方法有时结论相反

当Sobel检验显示p = .067(不显著),而Bootstrap 95% CI = [0.01, 0.29](显著),这不是矛盾,而是方法学上可预期的分歧,背后有三个原因:

原因一:Sobel使用对称置信区间,Bootstrap使用非对称CI

Sobel基于正态假设,构建的是以 a×b 为中心的对称CI。而 a×b 的真实抽样分布通常是右偏的(尤其当两个路径同号且较强时),Bootstrap捕捉到了这种偏度,构建非对称CI——这使得Bootstrap CI更窄(更精确)。

原因二:Sobel的标准误估计本身有偏

Sobel公式是一阶Taylor展开近似,忽略了高阶项。当a或b较大时,这种近似误差不可忽略,导致SE高估,z值偏小,p值偏大(偏向不显著)。

原因三:小样本加剧了上述问题

N = 89时,Sobel检验的功效显著低于Bootstrap。随着N增大(> 500),两者结论越来越趋于一致——但这恰好说明大样本下才适合用Sobel,而大多数社科研究样本量并不足够大。


七、在ChatSRS上一键完成Bootstrap中介检验

打开 chatsrs.com,上传数据后输入:

"检验[M]在[X]对[Y]关系中的中介效应,使用5000次Bootstrap重抽样,输出BC校正95%置信区间;同时报告a路径、b路径、直接效应和总效应的系数和p值;给出判断完全中介/部分中介/无中介的结论,以及符合APA 7th格式的方法章节和结果章节模板,数值自动填入。"

ChatSRS同时支持Sobel检验参照输出,如需对比两种方法的结论,可在指令末尾加:

"同时输出Sobel检验的z值和p值,与Bootstrap结论进行对比说明。"

ChatSRS后台调用R语言 mediation 包或Hayes PROCESS逻辑,抽样次数、校正方法(Percentile/BC/BCa)均可在指令中指定,结果段落可直接复制进论文。


八、方法章节标准描述

推荐写法(Bootstrap为主)

采用路径分析检验[M]在[X]与[Y]关系中的中介作用。
间接效应的显著性采用Bootstrap重抽样法(5000次)评估,
构建95%偏差校正置信区间(BC Bootstrap CI)。
若95% CI不含零,则判定间接效应在alpha = .05水平上显著
(Preacher & Hayes, 2008)。统计分析使用ChatSRS(R引擎)完成。

如需提及Sobel检验

中介效应显著性检验采用两种方法:
(1)Sobel检验(Sobel, 1982),用于与历史文献对比;
(2)Bootstrap重抽样法(5000次,BC校正;Preacher & Hayes, 2008),
作为主要判断依据。当两种方法结论不一致时,以Bootstrap结果为准,
原因在于Sobel检验对乘积分布正态性的假设在小样本中可能不成立
(MacKinnon et al., 2004)。

常见FAQ

Q:导师或审稿人仍然要求报告Sobel检验,但Bootstrap结论相反,怎么办?

A:可以同时报告两种方法,并在脚注或讨论中说明方法差异。标准表述为:"Sobel检验结果(z = X.XX,p = .067)与Bootstrap结果(95% CI = [0.01, 0.29])不一致,原因可能在于当前样本量(N = 89)下间接效应乘积分布偏离正态,Bootstrap结果更为可靠(MacKinnon et al., 2004),故本研究以Bootstrap为主要判断依据。"大多数现代期刊编辑和审稿人能接受这一解释。

Q:Bootstrap抽样次数设多少?5000次还是1000次?

A:主流标准是5000次(Hayes, 2018;Preacher & Hayes, 2008建议)。1000次在大样本下勉强够用,但在小样本下CI估计不够稳定。10000次以上对精度的额外提升已经很小,日常分析中5000次是性价比最优的选择。方法章节务必注明抽样次数,例如"5000次Bootstrap重抽样",审稿人会核查这一细节。

Q:BC Bootstrap和BCa Bootstrap哪个更准确?用哪个?

A:BCa(偏差校正加速,Bias-Corrected and Accelerated)在理论上优于BC(只校正偏差/bias,不校正加速度),但在实际社科研究中两者结论几乎没有差异。Hayes的PROCESS宏(最广泛使用的中介分析工具)默认使用BC Bootstrap,因此绝大多数论文报告BC Bootstrap即可。如果用R语言的 boot 包,可以指定 type = "bca" 使用BCa。写论文时在括号内注明"BC校正"或"BCa校正"即可。

Q:Sobel检验显著(p = .032),Bootstrap CI却含零(95% CI = [−0.01, 0.28]),以哪个为准?

A:这种情况较少见但确实存在。以Bootstrap为准。当Bootstrap CI含零时,说明间接效应的不确定性范围包含"无效应"这一可能,不应断言显著。Sobel检验显著但Bootstrap不支持,通常出现在BC Bootstrap对极端偏度的校正导致CI向一侧移动的情况。此时应报告"Bootstrap检验未支持显著中介效应(95% CI = [−0.01, 0.28])",不能仅凭Sobel的p值下结论。

Q:中介效应需要同时做Sobel检验和Baron & Kenny四步法吗?

A:Baron & Kenny(1986)的四步法(依次检验总效应、a路径、b路径和直接效应是否显著)已逐渐被现代中介分析取代,主要问题是:要求总效应显著才能进行中介检验,这一前提并无理论必要性,且功效较低。现代推荐做法是:直接报告Bootstrap间接效应的CI,无需通过四步法的每一步。Sobel检验同理,不需要与四步法配合使用。方法章节只需说明采用Bootstrap法检验间接效应即可。


参考文献

  • Baron, R. M., & Kenny, D. A. (1986). The moderator-mediator variable distinction in social psychological research: Conceptual, strategic, and statistical considerations. Journal of Personality and Social Psychology, 51(6), 1173–1182. https://doi.org/10.1037/0022-3514.51.6.1173
  • Efron, B. (1979). Bootstrap methods: Another look at the jackknife. The Annals of Statistics, 7(1), 1–26. https://doi.org/10.1214/aos/1176344552
  • Hayes, A. F. (2018). Introduction to mediation, moderation, and conditional process analysis: A regression-based approach (2nd ed.). Guilford Press.
  • MacKinnon, D. P., Lockwood, C. M., & Williams, J. (2004). Confidence limits for the indirect effect: Distribution of the product and resampling methods. Multivariate Behavioral Research, 39(1), 99–128. https://doi.org/10.1207/s15327906mbr3901_4
  • Preacher, K. J., & Hayes, A. F. (2008). Asymptotic and resampling strategies for assessing and comparing indirect effects in multiple mediator models. Behavior Research Methods, 40(3), 879–891. https://doi.org/10.3758/BRM.40.3.879
  • Sobel, M. E. (1982). Asymptotic confidence intervals for indirect effects in structural equation models. Sociological Methodology, 13, 290–312. https://doi.org/10.2307/270723

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。