统计百科 ·

偏相关与部分相关怎么算?控制变量后的相关怎么用 APA 报告

统计百科:偏相关(partial correlation)与零阶相关的区别,控制第三变量后如何计算偏相关系数,APA 7th 报告句式模板、效应量判断标准及 ChatSRS 一键输出完整方法段落。

你发现"冰淇淋销量"和"溺水人数"显著正相关——但两者都受"气温"驱动,控制气温后相关就消失了。这就是偏相关要解决的问题:从两个变量的关系中"剥去"第三变量的干扰,看剩下的净相关有多大。本文从概念到计算,从 SPSS 到 APA 报告,给你一套完整的操作手册。


一、为什么需要偏相关?

虚假相关与混淆变量

统计课上最经典的例子:

  • 城市消防员人数 ↑ → 火灾损失 ↑(正相关)
  • 鞋码大的孩子阅读能力更强(正相关)

两个例子都存在混淆变量(confounding variable):前者是"火灾规模",后者是"年龄/年级"。控制混淆变量后,表面上的相关大幅衰减甚至反转——这种现象叫 辛普森悖论(Simpson's Paradox) 的连续版本。

偏相关(partial correlation) 正是用来回答:

在统计控制变量 Z 之后,X 和 Y 之间还剩多少真实的线性关联?

零阶相关 vs 偏相关

指标含义控制变量
零阶相关(zero-order correlation)X 与 Y 的直接 Pearson r,未控制任何变量
偏相关(partial correlation)控制一个或多个协变量 Z 后,X 与 Y 的净相关控制全部 Z
半偏相关(semi-partial / part correlation)只从 X 中去除 Z 的影响,Y 不作处理仅控制 X 侧

三者数值上:|零阶 r| >= |偏 r| >= |半偏 r|(通常如此,但不绝对)。


二、偏相关的数学原理

2.1 基于残差的直觉解释

控制变量 Z 后,X 与 Y 的偏相关等价于:

  1. 用 Z 回归 X,取残差 $e_{X \cdot Z}$(去除 Z 对 X 的线性影响)
  2. 用 Z 回归 Y,取残差 $e_{Y \cdot Z}$(去除 Z 对 Y 的线性影响)
  3. 计算这两组残差的 Pearson 相关

$r_{XY \cdot Z} = r(e_{X \cdot Z},\ e_{Y \cdot Z})$

这个过程称为 "偏出"(partialling out) 变量 Z。

2.2 代数公式(单个控制变量)

已知三个变量的零阶相关系数 $r_{XY}$、$r_{XZ}$、$r_{YZ}$,可直接计算偏相关:

$r_{XY \cdot Z} = \frac{r_{XY} - r_{XZ} \cdot r_{YZ}}{\sqrt{(1 - r_{XZ}^2)(1 - r_{YZ}^2)}}$

示例

  • $r_{XY} = .52$(学习时间与成绩)
  • $r_{XZ} = .48$(学习时间与学习动机)
  • $r_{YZ} = .61$(成绩与学习动机)

$r_{XY \cdot Z} = \frac{.52 - .48 \times .61}{\sqrt{(1-.48^2)(1-.61^2)}} = \frac{.52 - .293}{\sqrt{.770 \times .628}} = \frac{.227}{.695} = .327$

控制学习动机后,学习时间与成绩的偏相关从 .52 降至 .327,说明动机解释了两者相关的一部分。

2.3 多个控制变量

控制 $Z_1, Z_2, \ldots, Z_k$ 时,偏相关通过偏相关矩阵(逆相关矩阵)计算,超出手算范围,直接用软件输出。


三、显著性检验与效应量

3.1 t 检验

偏相关系数的显著性通过 t 检验评估:

$t = r_{XY \cdot Z} \sqrt{\frac{n - 2 - k}{1 - r_{XY \cdot Z}^2}}$

  • $n$ = 样本量
  • $k$ = 控制变量个数
  • 自由度:$df = n - 2 - k$

3.2 Cohen (1988) 效应量参考标准

偏相关系数与 Pearson r 使用相同的效应量标准:

| 效应大小 | |r| 参考值 | |---|---| | 小效应 | .10 | | 中效应 | .30 | | 大效应 | .50 |

注意:偏相关系数通常小于对应的零阶相关,控制变量越多,偏相关往往越小。


四、半偏相关(part correlation)

与偏相关的区别

半偏相关(也叫部分相关,semi-partial correlation)只从 X 中去除 Z 的影响,Y 保持原始值:

$r_{X(Y \cdot Z)} = \frac{r_{XY} - r_{XZ} \cdot r_{YZ}}{\sqrt{1 - r_{XZ}^2}}$

区别总结

偏相关半偏相关
从 X 中去除 Z 影响
从 Y 中去除 Z 影响
主要用途报告"净相关"、控制混淆变量回归分析中报告每个预测变量的独特方差贡献
平方含义$sr^2$ = 该变量独立解释的 $R^2$ 增量

在层级回归(hierarchical regression)中,每个变量的半偏相关平方 $sr^2$ 等于该变量加入模型后的 $\Delta R^2$,是报告"增量效度"的标准指标。


五、APA 7th 偏相关报告模板

5.1 必报要素

要素格式示例
偏相关系数$r_p$ 或 $r_{XY \cdot Z}$$r_p = .33$
自由度df = n - 2 - kdf = 97
p 值p = .XXX 或 p < .001p = .001
控制变量说明文字说明控制了哪些变量控制年龄和性别后
效应量解读参照 Cohen 标准中等效应

5.2 标准报告句式(单个控制变量)

场景:控制学习动机(Z)后,学习时间(X)与期末成绩(Y)的偏相关,n = 100。

控制学习动机后,学习时间与期末成绩呈显著正相关,
r_p(97) = .33,p = .001,为中等效应(Cohen,1988)。
零阶相关为 r(98) = .52,p < .001;控制学习动机后相关系数减小,
表明学习动机对两者关系具有一定的混淆作用。

格式要点

  • 偏相关符号:$r_p$(下标 p 代表 partial)或 $r_{XY \cdot Z}$,论文中保持一致即可
  • 括号内写自由度 df = n - 2 - k(不是 n - 1)
  • p 值不加前导零:p = .001,不写 p = 0.001
  • 同时报告零阶相关作对比,便于读者评估混淆变量影响程度

5.3 多个控制变量的报告句式

场景:控制性别和年龄后,社交媒体使用时间与焦虑水平的偏相关,n = 200。

在控制性别和年龄的情况下,社交媒体使用时间与焦虑水平呈显著正相关,
r_p(196) = .28,p < .001,为中等偏小效应(Cohen,1988)。
未控制协变量时,零阶相关为 r(198) = .35,p < .001。
上述结果表明,即便排除人口统计学变量的影响,
社交媒体使用与焦虑之间仍存在独立的正向关联。

5.4 偏相关矩阵的报告

当同时报告多对偏相关时,使用矩阵表格格式:

表 X 呈现了在控制 [协变量] 后各变量间的偏相关矩阵(N = XXX)。
结果显示,[变量1] 与 [变量2] 呈显著正相关(r_p = .XX,p < .001),
[变量1] 与 [变量3] 的关联未达显著(r_p = .XX,p = .XXX)。

表格格式参考(下三角矩阵,APA 标准):

变量123MSD
1. 学习时间4.21.1
2. 学习动机.48**3.80.9
3. 期末成绩.33**.61**78.59.2

注. 偏相关已控制 [协变量]。**p < .01。

5.5 不显著时的报告

控制 [协变量] 后,[X] 与 [Y] 的偏相关未达统计显著,
r_p([df]) = .[XX],p = .[XXX],表明 [协变量]
可能是两者零阶相关(r(n-2) = .[XX],p = .[XXX])的主要混淆来源。

六、方法章节的标准描述

分析方法说明(可直接套用)

为检验控制 [协变量名称] 后 [X] 与 [Y] 的净相关,
本研究采用偏相关分析(partial correlation analysis)。
显著性检验基于 t 分布,自由度为 n - 2 - k
(n = 样本量,k = 控制变量个数)。
效应量参照 Cohen(1988)标准
(|r| = .10 为小效应,.30 为中效应,.50 为大效应)。
同时报告零阶相关以便与偏相关进行比较。
统计分析使用 ChatSRS(R 引擎),显著性水平设为 alpha = .05。

七、在 ChatSRS 一键获得偏相关报告

打开 chatsrs.com,上传数据后输入:

"对变量 学习时间 和 期末成绩 做偏相关分析,控制变量为 学习动机;同时输出零阶相关和偏相关系数、t 值、自由度、p 值,以及符合 APA 7th 格式的报告段落,包含效应量解读(Cohen 1988 标准)。"

ChatSRS 将输出:

  • 零阶相关矩阵(含所有变量两两 Pearson r)
  • 偏相关系数 $r_p$、t 值、df、p 值
  • 可直接粘贴进论文结果章节的 APA 格式段落
  • 方法章节描述模板

如需报告偏相关矩阵(多对变量同时控制协变量),可在指令中说明"输出偏相关矩阵,控制变量为 XX",ChatSRS 自动生成下三角矩阵表格及配套文字。


八、偏相关 vs 相关 vs 回归:怎么选?

这是实操中最常见的困惑。

研究目的推荐方法
描述 X 与 Y 的线性关联,无控制变量Pearson / Spearman 零阶相关
控制混淆变量后,X 与 Y 的净相关偏相关
只控制 X 侧,报告 X 对 Y 的独特贡献半偏相关(层级回归中的 sr)
一个 X 预测 Y,同时报告其他协变量多元线性回归
多个 X 同时预测 Y,报告各自贡献层级回归 + $\Delta R^2$ + 半偏 r

使用偏相关的典型场景

  • 两变量均有明确的混淆变量需要控制(如年龄、性别、基线分数)
  • 想在散点图上直观呈现"控制后的净关系"
  • 文献综述或元分析需要报告控制后的相关作为效应量指标

九、常见错误与对照

常见错误正确做法
偏相关写 df = n - 2(忘减控制变量数)df = n - 2 - k(k = 控制变量个数)
只报告偏相关,不报告零阶相关同时呈现零阶与偏相关,便于读者评估混淆程度
混淆"偏相关"与"半偏相关"偏相关两侧均去除 Z;半偏相关只去除 X 侧
p 值写 p = 0.001p 值不加前导零:p = .001(APA 规范)
将偏相关系数解读为"因果关系"相关分析不能推断因果,只能说"净线性关联"
控制变量选择随意控制变量需有理论依据,避免过度控制(删除中介变量)

常见 FAQ

Q:偏相关控制了变量,能说明因果关系吗?

A:不能。偏相关仍是相关分析,控制变量只是统计控制(statistical control),不等于实验控制。控制 Z 后 X 与 Y 仍显著,只说明"在 Z 水平相同的子群体中,X 与 Y 仍有线性关联",无法排除其他未测量混淆变量的影响。要推断因果,需要随机分配(实验设计)或特定的因果推断框架(如工具变量、断点回归)。

Q:控制了中介变量,偏相关系数接近零——这说明什么?

A:这说明 Z 可能是 X → Y 路径上的中介变量(mediator),而非混淆变量(confounder)。控制中介变量会"阻断"X 对 Y 的间接效应,导致偏相关接近零,这并不是"没有关系",而是"X 通过 Z 影响 Y"。因此,选择控制哪些变量需要有理论依据,不能把所有相关变量都一股脑控制掉。如需正式检验中介效应,应使用 Bootstrap 中介分析(参见 Bootstrap 中介效应报告)。

Q:偏相关和 ANCOVA 有什么关系?

A:两者思路相同——都在统计层面"去除"协变量的影响。ANCOVA 控制协变量后比较组别均值差异(F 检验),偏相关控制协变量后描述两个连续变量之间的线性关联(r 值)。实质上,在两组(二分类 X)对连续 Y 做偏相关,与 ANCOVA 的 F 检验在数学上等价:$r_p^2 = \frac{F \cdot df_1}{F \cdot df_1 + df_2}$。

Q:Spearman 有没有偏相关版本?

A:有,但不常用。可以先将所有变量秩转换,再用偏相关公式计算秩的偏相关(称为偏 Spearman 相关)。实践中,如果数据明显非正态,更常见的做法是先对原始数据做对数或 Box-Cox 变换,再做偏 Pearson 相关,而非直接用偏 Spearman。ChatSRS 支持对秩数据直接计算偏相关,在指令中注明"使用 Spearman 秩相关"即可。

Q:样本量多少才够做偏相关?

A:偏相关的统计功效随控制变量增多而下降(df = n - 2 - k)。一般建议:每加入一个控制变量,样本量额外增加 10-20 人。控制 2 个变量的偏相关,建议 n >= 100,中效应(r = .30)在 alpha = .05 双尾时约需 84 人(Cohen,1988),加上控制变量余量建议 n >= 100-120。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。