统计百科 ·
Sobel检验还是Bootstrap?中介效应显著性检验怎么选
统计百科:深入对比Sobel检验与Bootstrap两种中介效应显著性检验方法——正态分布假设差异、小样本表现、APA 7th报告格式区别,给出可直接套用的论文报告模板,帮你选对方法、写对格式。
中介效应分析里,"间接效应显不显著"这个问题有两套主流解法:经典的Sobel检验和现代的Bootstrap法。两者给出的结论有时一致,有时却截然相反——你用Sobel检验说"不显著(p = .067)",导师或审稿人偏偏要求"跑Bootstrap",结果95% CI不含0,反而显著了。到底哪个对?为什么会不一样?这篇文章从统计原理出发,给出清晰的选用逻辑,并附APA 7th可套用的报告句式。
你遇到过这些困惑吗?
- 用Sobel检验,p = .067,间接效应"不显著";换Bootstrap,95% CI = [0.02, 0.34],"又显著了",哪个可信?
- 论文方法章节该写"采用Sobel检验"还是"采用Bootstrap法"?
- 审稿人要求"报告Bootstrap置信区间",Sobel的p值不够用吗?
- 样本量只有80人,还能用Sobel检验吗?
- 偏差校正Bootstrap(BC Bootstrap)和百分位Bootstrap有什么区别?
这些问题的核心分歧只有一个:Sobel检验假设间接效应的抽样分布是正态的,Bootstrap不做这个假设。理解了这一点,选哪种方法就清楚了。
如果你对中介效应的基本概念和APA报告格式还不熟悉,建议先读姊妹篇 中介效应APA报告怎么写?,本文默认你已了解a路径、b路径和间接效应 a×b 的含义。
一、中介效应的间接效应是什么
在经典三变量中介模型中:
$X \xrightarrow{a} M \xrightarrow{b} Y$
间接效应 = a × b,即自变量X经由中介变量M影响因变量Y的那部分效应。
显著性检验的核心问题:间接效应 a×b 是否显著不同于零?
这看起来简单,但有一个统计难题:a×b是两个随机变量的乘积,其抽样分布通常不是正态分布,尤其在:
- 样本量较小时(N < 200)
- a、b路径系数本身不显著时
- 两个路径系数中有一个接近零时
正是这个乘积分布的非正态性,导致了Sobel检验和Bootstrap在小样本或弱效应情境下的分歧。
二、Sobel检验:经典但有局限
原理
Sobel检验(Sobel, 1982)将间接效应的标准误估计为:
$SE_{ab} = \sqrt{b^2 \cdot SE_a^2 + a^2 \cdot SE_b^2}$
然后用 $z = \frac{a \times b}{SE_{ab}}$ 计算z统计量,与标准正态分布比较,得出p值。
核心假设
Sobel检验假设间接效应 a×b 的抽样分布近似正态。这个假设在以下条件下成立:
- 样本量足够大(通常要求 N > 200,偏保守的文献要求 N > 500)
- a路径和b路径均较强且显著
- 总体中真实效应不极端(非极度偏态)
问题所在
a×b乘积的分布几乎从不是正态的。即使a和b各自服从正态,它们的乘积分布也是有偏的(skewed),在小样本或弱路径系数的情境下尤为明显(MacKinnon, Lockwood, & Williams, 2004)。
后果:Sobel检验存在系统性功效损失——它本来就比Bootstrap保守,更容易出现假阴性(真实存在中介效应但被判为不显著)。这不是"两种方法都对",而是Sobel检验在方法论上有已知的局限。
Sobel检验适用场景
尽管如此,Sobel检验在以下情形仍有一定参考价值:
| 条件 | 是否适用Sobel |
|---|---|
| N > 1000,大样本 | 勉强可用(分布趋近正态) |
| 仅做探索性分析,不发表 | 可作为初步参考 |
| 旧期刊/早年研究复现 | 保留Sobel以便对比 |
| 主要结果报告 | 不推荐,应用Bootstrap |
三、Bootstrap:无分布假设的现代标准
原理
Bootstrap(Efron, 1979)是一种重抽样(resampling)方法:
- 从原始样本(N个观测)中有放回地随机抽取N个观测,构成一个"Bootstrap样本"
- 在该Bootstrap样本上重新估计路径系数,计算 a×b
- 重复上述过程B次(通常B = 5000次)
- 用这B个 a×b 值构建经验抽样分布
- 取该分布的2.5和97.5百分位数,构成95% Bootstrap置信区间(CI)
如果95% CI不含零,则间接效应显著(alpha = .05)。
为什么Bootstrap更优
Bootstrap不对间接效应的分布做任何参数假设。它直接从数据中"经验性地"估计抽样分布,因此:
- 对乘积分布的非正态性天然免疫
- 在小样本(N = 50~200)下依然保持较好的Type I错误率控制
- 统计功效系统性高于Sobel检验(MacKinnon et al., 2004; Preacher & Hayes, 2008)
MacKinnon等人(2004)的模拟研究(此后被引用数千次)明确结论:Bootstrap法在中介效应检验中的功效显著优于Sobel检验,且一类错误率(虚警率)控制更准确。
两种Bootstrap变体
| 方法 | 中文名 | 原理 | 适用 |
|---|---|---|---|
| Percentile Bootstrap | 百分位Bootstrap | 直接取经验分布的百分位数 | 一般情形 |
| BC Bootstrap | 偏差校正Bootstrap | 在百分位基础上校正抽样分布的偏差(bias) | 效应分布偏斜时 |
| BCa Bootstrap | 偏差校正加速Bootstrap | 同时校正偏差(bias)和加速度(acceleration) | 效应分布极度偏斜时 |
实际操作中,**BC Bootstrap(Bias-Corrected Bootstrap)**是最常用的选择,Hayes(2018)的PROCESS宏默认使用BC Bootstrap。详见姊妹篇 Bootstrap中介效应CI怎么做?。
四、Sobel vs Bootstrap核心对比
| 维度 | Sobel检验 | Bootstrap |
|---|---|---|
| 分布假设 | 假设 a×b 服从正态分布 | 无参数分布假设 |
| 推断指标 | z统计量 + p值 | 置信区间(CI) |
| 小样本(N < 200) | 偏保守,功效损失大 | 表现较稳健 |
| 大样本(N > 1000) | 与Bootstrap结论接近 | 仍推荐 |
| 统计功效 | 系统性低于Bootstrap | 更高 |
| 计算复杂度 | 一步计算,极简 | 需重抽样(软件自动完成) |
| 现代期刊接受度 | 降低(仅少数旧期刊) | 主流标准 |
| APA 7th推荐 | 未特别推荐 | 推荐(Psychological Methods) |
| 输出格式 | z = X.XX, p = .XXX | 95% CI [LL, UL] |
结论:除非有特殊理由(如复现早期研究、期刊明确要求),现代研究应优先采用Bootstrap法。
五、两种方法的APA 7th报告格式
Sobel检验报告模板(仅供对比/历史参考)
采用Sobel检验评估[M]在[X]对[Y]影响中的中介效应。
结果显示,间接效应a×b = X.XXX,SE = X.XXX,
z = X.XX,p = .XXX。
[间接效应显著/不显著](p [< / >] .05),[M]对[X]→[Y]路径
[起到/不起到]显著中介作用。
填入数值的示例:
采用Sobel检验(Sobel, 1982)评估工作满意度(M)在自主性(X)对离职意向(Y)影响中的中介效应。结果显示,间接效应 a×b = −0.124,SE = 0.068,z = −1.82,p = .069。间接效应未达显著(p > .05),Sobel检验未支持工作满意度的中介作用。
Bootstrap报告模板(推荐)
方法章节:
采用Bootstrap重抽样法(5000次)构建间接效应的95%偏差校正置信区间
(BC Bootstrap CI;Preacher & Hayes, 2008),
以评估[M]在[X]与[Y]关系中的中介效应。
结果章节:
Bootstrap分析结果(5000次重抽样)显示,
[X]经由[M]对[Y]的间接效应为a×b = X.XXX(SE = X.XXX),
95% BC Bootstrap CI = [LL, UL],置信区间[不含/含]零,
间接效应[显著/不显著](Hayes, 2018)。
填入数值的示例:
Bootstrap分析结果(5000次重抽样)显示,自主性经由工作满意度对离职意向的间接效应为 a×b = −0.124(SE = 0.063),95% BC Bootstrap CI = [−0.267, −0.014],置信区间不含零,间接效应显著(Hayes, 2018)。在控制间接效应后,自主性对离职意向的直接效应为 b = −0.187(SE = 0.074),95% CI = [−0.332, −0.042],亦达显著水平,表明工作满意度发挥部分中介作用。
同时报告Sobel和Bootstrap的情形
在需要与历史文献对比、或期刊要求提供多种检验结果时,可同时报告两种方法:
以Sobel检验为参照(z = −1.82,p = .069,未达显著),同时采用Bootstrap重抽样法(5000次,BC校正)构建95% CI,间接效应 a×b = −0.124,95% CI = [−0.267, −0.014],置信区间不含零,Bootstrap结果支持中介效应显著。两种方法结论不一致,源于Sobel检验对乘积分布正态性的假设在本样本中(N = 89)可能不成立,Bootstrap结果为主要参照(MacKinnon et al., 2004)。
六、为什么两种方法有时结论相反
当Sobel检验显示p = .067(不显著),而Bootstrap 95% CI = [0.01, 0.29](显著),这不是矛盾,而是方法学上可预期的分歧,背后有三个原因:
原因一:Sobel使用对称置信区间,Bootstrap使用非对称CI
Sobel基于正态假设,构建的是以 a×b 为中心的对称CI。而 a×b 的真实抽样分布通常是右偏的(尤其当两个路径同号且较强时),Bootstrap捕捉到了这种偏度,构建非对称CI——这使得Bootstrap CI更窄(更精确)。
原因二:Sobel的标准误估计本身有偏
Sobel公式是一阶Taylor展开近似,忽略了高阶项。当a或b较大时,这种近似误差不可忽略,导致SE高估,z值偏小,p值偏大(偏向不显著)。
原因三:小样本加剧了上述问题
N = 89时,Sobel检验的功效显著低于Bootstrap。随着N增大(> 500),两者结论越来越趋于一致——但这恰好说明大样本下才适合用Sobel,而大多数社科研究样本量并不足够大。
七、在ChatSRS上一键完成Bootstrap中介检验
打开 chatsrs.com,上传数据后输入:
"检验[M]在[X]对[Y]关系中的中介效应,使用5000次Bootstrap重抽样,输出BC校正95%置信区间;同时报告a路径、b路径、直接效应和总效应的系数和p值;给出判断完全中介/部分中介/无中介的结论,以及符合APA 7th格式的方法章节和结果章节模板,数值自动填入。"
ChatSRS同时支持Sobel检验参照输出,如需对比两种方法的结论,可在指令末尾加:
"同时输出Sobel检验的z值和p值,与Bootstrap结论进行对比说明。"
ChatSRS后台调用R语言 mediation 包或Hayes PROCESS逻辑,抽样次数、校正方法(Percentile/BC/BCa)均可在指令中指定,结果段落可直接复制进论文。
八、方法章节标准描述
推荐写法(Bootstrap为主)
采用路径分析检验[M]在[X]与[Y]关系中的中介作用。
间接效应的显著性采用Bootstrap重抽样法(5000次)评估,
构建95%偏差校正置信区间(BC Bootstrap CI)。
若95% CI不含零,则判定间接效应在alpha = .05水平上显著
(Preacher & Hayes, 2008)。统计分析使用ChatSRS(R引擎)完成。
如需提及Sobel检验
中介效应显著性检验采用两种方法:
(1)Sobel检验(Sobel, 1982),用于与历史文献对比;
(2)Bootstrap重抽样法(5000次,BC校正;Preacher & Hayes, 2008),
作为主要判断依据。当两种方法结论不一致时,以Bootstrap结果为准,
原因在于Sobel检验对乘积分布正态性的假设在小样本中可能不成立
(MacKinnon et al., 2004)。
常见FAQ
Q:导师或审稿人仍然要求报告Sobel检验,但Bootstrap结论相反,怎么办?
A:可以同时报告两种方法,并在脚注或讨论中说明方法差异。标准表述为:"Sobel检验结果(z = X.XX,p = .067)与Bootstrap结果(95% CI = [0.01, 0.29])不一致,原因可能在于当前样本量(N = 89)下间接效应乘积分布偏离正态,Bootstrap结果更为可靠(MacKinnon et al., 2004),故本研究以Bootstrap为主要判断依据。"大多数现代期刊编辑和审稿人能接受这一解释。
Q:Bootstrap抽样次数设多少?5000次还是1000次?
A:主流标准是5000次(Hayes, 2018;Preacher & Hayes, 2008建议)。1000次在大样本下勉强够用,但在小样本下CI估计不够稳定。10000次以上对精度的额外提升已经很小,日常分析中5000次是性价比最优的选择。方法章节务必注明抽样次数,例如"5000次Bootstrap重抽样",审稿人会核查这一细节。
Q:BC Bootstrap和BCa Bootstrap哪个更准确?用哪个?
A:BCa(偏差校正加速,Bias-Corrected and Accelerated)在理论上优于BC(只校正偏差/bias,不校正加速度),但在实际社科研究中两者结论几乎没有差异。Hayes的PROCESS宏(最广泛使用的中介分析工具)默认使用BC Bootstrap,因此绝大多数论文报告BC Bootstrap即可。如果用R语言的 boot 包,可以指定 type = "bca" 使用BCa。写论文时在括号内注明"BC校正"或"BCa校正"即可。
Q:Sobel检验显著(p = .032),Bootstrap CI却含零(95% CI = [−0.01, 0.28]),以哪个为准?
A:这种情况较少见但确实存在。以Bootstrap为准。当Bootstrap CI含零时,说明间接效应的不确定性范围包含"无效应"这一可能,不应断言显著。Sobel检验显著但Bootstrap不支持,通常出现在BC Bootstrap对极端偏度的校正导致CI向一侧移动的情况。此时应报告"Bootstrap检验未支持显著中介效应(95% CI = [−0.01, 0.28])",不能仅凭Sobel的p值下结论。
Q:中介效应需要同时做Sobel检验和Baron & Kenny四步法吗?
A:Baron & Kenny(1986)的四步法(依次检验总效应、a路径、b路径和直接效应是否显著)已逐渐被现代中介分析取代,主要问题是:要求总效应显著才能进行中介检验,这一前提并无理论必要性,且功效较低。现代推荐做法是:直接报告Bootstrap间接效应的CI,无需通过四步法的每一步。Sobel检验同理,不需要与四步法配合使用。方法章节只需说明采用Bootstrap法检验间接效应即可。
参考文献
- Baron, R. M., & Kenny, D. A. (1986). The moderator-mediator variable distinction in social psychological research: Conceptual, strategic, and statistical considerations. Journal of Personality and Social Psychology, 51(6), 1173–1182. https://doi.org/10.1037/0022-3514.51.6.1173
- Efron, B. (1979). Bootstrap methods: Another look at the jackknife. The Annals of Statistics, 7(1), 1–26. https://doi.org/10.1214/aos/1176344552
- Hayes, A. F. (2018). Introduction to mediation, moderation, and conditional process analysis: A regression-based approach (2nd ed.). Guilford Press.
- MacKinnon, D. P., Lockwood, C. M., & Williams, J. (2004). Confidence limits for the indirect effect: Distribution of the product and resampling methods. Multivariate Behavioral Research, 39(1), 99–128. https://doi.org/10.1207/s15327906mbr3901_4
- Preacher, K. J., & Hayes, A. F. (2008). Asymptotic and resampling strategies for assessing and comparing indirect effects in multiple mediator models. Behavior Research Methods, 40(3), 879–891. https://doi.org/10.3758/BRM.40.3.879
- Sobel, M. E. (1982). Asymptotic confidence intervals for indirect effects in structural equation models. Sociological Methodology, 13, 290–312. https://doi.org/10.2307/270723
相关阅读
- 中介效应APA报告怎么写?a×b间接效应+Bootstrap CI格式全解
- Bootstrap中介效应CI怎么做?5000次抽样与百分位/BC校正完全指南
- 正态性怎么判断?Shapiro-Wilk、K-S检验与偏度峰度完整指南
本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。