统计百科 ·

Cook距离和杠杆值怎么识别回归强影响点?— Cook's D、杠杆值、标准化残差诊断完全指南

统计百科:系统讲解Cook距离(Cook's D>4/n判断标准)、帽子矩阵杠杆值(h_ii>2p/n)、标准化残差与学生化残差的区别,以及如何综合三类指标识别线性回归中的强影响点、高杠杆点和异常值,附APA 7th报告模板。

回归模型跑出来了,R² 挺高,但某几个观测值一旦删掉,系数估计就大幅变动——这就是强影响点(influential observation)在作怪。识别它们靠三把尺子:Cook距离(整体影响力)、杠杆值(自变量空间异常性)和标准化残差(因变量异常性)。三者含义不同,不能互相替代,组合使用才能完整诊断。本文逐一拆解每个指标的计算逻辑、判断标准与 APA 7th 报告写法。


你的回归分析有这些困惑吗?

导师或审稿人常见反馈:

  • "Cook距离的判断标准到底是 1 还是 4/n?两种说法都见过"
  • "杠杆值和Cook距离有什么区别,高杠杆点一定是强影响点吗?"
  • "标准化残差和学生化残差(studentized residual)是同一个指标吗?"
  • "方法章节要不要说明如何处理强影响点?"
  • "删掉异常点还是保留,论文里怎么交代才不会被审稿人质疑?"

这些问题集中在**回归影响分析(regression influence diagnostics)**这一领域。本文只讲一件事:三类诊断指标分别是什么、怎么用、APA 7th 怎么报告

如果你还没看过姊妹篇 多元线性回归完整教程,建议先读那篇了解基础回归框架,本文默认你已知道 OLS 估计和残差的基本概念。


一、三类诊断指标的逻辑定位

在识别"问题观测值"时,统计学区分了三种不同含义的异常:

类型核心问题主要指标
异常值(outlier)因变量 Y 偏离预测值有多远?标准化残差、学生化残差
高杠杆点(high-leverage point)观测值在自变量空间是否处于极端位置?杠杆值 h_ii(帽子矩阵对角元)
强影响点(influential observation)删掉该观测后,回归系数估计变化有多大?Cook's D、DFFITS、DFBETAS

三者关系如下:

  • 高杠杆点 + 大残差 = 几乎必然是强影响点
  • 高杠杆点 + 小残差 = 可能是"好的高杠杆点",对模型拟合有益
  • 低杠杆点 + 大残差 = 异常值,但对系数估计影响不一定大
  • Cook's D 是杠杆值和残差的综合函数,直接量化影响力

二、Cook距离(Cook's D)

计算公式与直觉含义

Cook(1977)提出的影响力指标,核心思想是:删掉第 i 个观测后,所有预测值的变化有多大?

$D_i = \frac{\sum_{j=1}^{n}(\hat{y}j - \hat{y}{j(i)})^2}{p \cdot MSE}$

其中:

  • $\hat{y}_j$ = 使用全样本估计的第 j 个预测值
  • $\hat{y}_{j(i)}$ = 删去第 i 个观测后重新估计的第 j 个预测值
  • $p$ = 模型参数个数(含截距)
  • $MSE$ = 均方误差

等价表达形式(更便于理解):

$D_i = \frac{e_i^2}{p \cdot MSE} \cdot \frac{h_{ii}}{(1 - h_{ii})^2}$

这个形式揭示了 Cook's D = 残差的贡献 × 杠杆值的贡献。无论哪一个极端,都会抬高 D_i。

判断标准:4/n 还是 1?

实践中最广泛使用的标准是 $D_i > 4/n$(n 为样本量),这是更保守(更敏感)的筛查阈值:

标准含义适用场合
$D_i > 4/n$相对于平均水平偏高的影响力样本量中等到大(n >= 30),初步筛查,论文推荐
$D_i > 1$影响力达到 F 分布临界值附近传统严格标准,实际很少超越,常用于最终判断
$D_i > 4/(n-p-1)$Fox(2016)修正版小样本下的严格检验

为什么论文中更多见 4/n 而非 1?

当 n = 200,4/n = 0.02;当 n = 50,4/n = 0.08。与样本量成反比,能自动适应"大样本时即使 D_i = 0.15 也可能很异常"的情形。阈值为 1 时,只有极少数观测(通常是数据录入错误或极端值)才会超过,容易漏掉真正有影响的观测。

APA 7th 报告写法:论文方法章节应说明使用了哪个标准,结果章节报告被识别的观测数量。

Cook's D 的分布参考

Cook(1977)建议以 $F(p, n-p)$ 分布的百分位数作为参照基准来评估 $D_i$ 的大小,而非声称 $D_i$ 的抽样分布本身服从 F 分布。若 $D_i$ 对应的 F 分布累积概率超过 0.50(即 $D_i > F_{0.50, p, n-p}$ 的中位数),则该观测的影响力已超过半数 F 分布参照值,值得关注;超过 0.80 则高度警示。

但在实际写论文时,直接用 4/n 阈值更直观,也更常见于心理学和社会科学期刊。


三、杠杆值(Leverage)

帽子矩阵与 h_ii

杠杆值 $h_{ii}$ 来自帽子矩阵(hat matrix)$\mathbf{H}$:

$\mathbf{H} = \mathbf{X}(\mathbf{X}^T\mathbf{X})^{-1}\mathbf{X}^T$

$\hat{\mathbf{y}} = \mathbf{H}\mathbf{y} \quad \Rightarrow \quad \text{"H 把 y 变成 } \hat{y}\text{",故称帽子矩阵}$

$h_{ii}$ 是矩阵 H 的第 i 个对角元,取值范围为 $[1/n,\ 1]$:

  • $h_{ii} = 1/n$:第 i 个观测在自变量空间最"普通",影响力最低
  • $h_{ii} \to 1$:第 i 个观测对自身预测值完全决定,有点像"自我实现"
  • $\bar{h} = p/n$(所有杠杆值的均值),p 为参数个数含截距

杠杆值衡量的是自变量空间的极端性,与 Y 值无关。

判断标准

广泛使用的阈值:$h_{ii} > 2p/n$(或 $3p/n$ 用于更保守标准)

标准说明
$h_{ii} > 2p/n$Hoaglin & Welsch(1978)推荐的常用阈值
$h_{ii} > 3p/n$更保守,减少误报
$h_{ii} > 0.5$Chatterjee & Hadi(2006)建议的绝对阈值

例如:5 个预测变量 + 截距(p = 6),N = 200,则 $2p/n = 12/200 = 0.06$,超过 0.06 的观测被标记为高杠杆点。

杠杆值和 Cook's D 的关系

如前述公式所示,Cook's D 包含 $h_{ii}/(1-h_{ii})^2$ 这一项。当 $h_{ii} \to 1$ 时,该项趋向无穷大,即使残差不大,Cook's D 也会很高。这就是为什么高杠杆点即使预测值精准,也应引起重视——它们"塑造"了回归平面本身。


四、标准化残差与学生化残差

区别汇总

指标公式特点判断阈值
原始残差$e_i = y_i - \hat{y}_i$量纲依赖数据,难以比较
标准化残差(standardized residual)$r_i = e_i / \sqrt{MSE}$近似标准正态,但忽略了杠杆值的影响$|r_i| > 2$ 或
gt; 3$
内部学生化残差(internally studentized)$r_i^* = e_i / \sqrt{MSE(1-h_{ii})}$考虑杠杆值,比标准化更准确;大多数软件"标准化残差"实际是此项$|r_i^*| > 2$ 或
gt; 3$
外部学生化残差(externally studentized / studentized deleted residual)$t_i = e_i / \sqrt{MSE_{(i)}(1-h_{ii})}$删去第 i 个观测后重新估计 MSE,服从 t(n-p-1) 分布,最严格$|t_i| > t_{0.025, n-p-1}$(Bonferroni 校正)

论文方法章节建议说明使用的是哪种残差,尤其要区分"标准化残差"(standardized residual)和"学生化残差"(studentized residual),二者在中文文献中常被混用。

Bonferroni 校正的外部学生化残差

多重比较问题:n 个观测同时检验时,需将 p 值阈值除以 n(Bonferroni 校正):

$|t_i| > t_{0.025/n,\ n-p-1}$

例:n = 200,p = 6,则阈值为 $t_{0.025/200,\ 193} = t_{0.000125,\ 193} \approx 3.88$

此时 $|t_i| > 3.88$ 才被判定为显著异常值(控制 FWER < .05)。


五、综合诊断:三指标联合判断

单一指标可能误判,推荐三指标联合的决策树:

第一步:检查标准化残差(|r*| > 3)→ 识别因变量异常值
第二步:检查杠杆值(h_ii > 2p/n)→ 识别自变量空间极端点
第三步:检查 Cook's D(D_i > 4/n)→ 识别强影响点

综合判断:
  高残差 + 高杠杆 + 高 D  → 高优先级强影响点,必须处置
  高杠杆 + 低残差 + 中等D → "好的"高杠杆点,一般保留
  高残差 + 低杠杆 + 低D  → 异常值,对系数影响小,可保留并说明
  三者均低                → 正常观测

附加指标(较复杂设计时使用):

  • DFFITS:删去第 i 个观测后第 i 个预测值的标准化变化,阈值 $|DFFITS_i| > 2\sqrt{p/n}$
  • DFBETAS:删去第 i 个观测后第 j 个回归系数的标准化变化,阈值 $|DFBETAS_{ij}| > 2/\sqrt{n}$
  • Mahalanobis 距离:多变量版本的杠杆值,检验 X 向量整体是否异常

六、完整 APA 7th 报告模板

方法章节描述模板

在执行多元线性回归分析前,对所有观测值进行影响力诊断。
以 Cook 距离(Cook's D > 4/n)识别强影响点,以帽子矩阵对角元
(h_ii > 2p/n)识别高杠杆点,以内部学生化残差(|r*| > 3)识别
异常值(Hoaglin & Welsch,1978;Cook,1977)。
对被识别的观测值,通过灵敏度分析(将其纳入与剔除后分别报告回归结果)
评估其对主要结论的影响。

结果章节报告模板(有强影响点)

影响力诊断显示,X 个观测值的 Cook 距离超过 4/n 阈值(D_i 范围 = [XX, XX]),
其中 X 个同时表现出高杠杆值(h_ii > 2p/n)和大标准化残差(|r*| > 3),
提示为强影响点。灵敏度分析表明,删去该 X 个观测后,[变量名] 的回归系数由
beta = .XX 变化为 beta = .XX,[主要结论未实质改变 / 结论发生变化,以下报告
删去强影响点后的结果]。最终分析基于 n = [XX] 个观测值进行(Cook,1977)。

结果章节报告模板(无强影响点)

影响力诊断未发现 Cook 距离超过 4/n 阈值(最大 D_i = X.XX)或高杠杆值
(最大 h_ii = X.XX,阈值 2p/n = X.XX)的观测值,全部 N = [XX] 个观测值
均保留于最终分析中。

可直接抄进论文的 APA 报告句式

回归影响力诊断显示,3 个观测值的 Cook 距离超过 4/n 阈值(D_i = 0.043、0.051 和 0.068,阈值 = 0.020),且均具有较高杠杆值(h_ii = 0.14、0.19 和 0.22,阈值 2p/n = 0.12)和较大标准化残差(|r*| = 3.2、2.8 和 3.7)。删去上述 3 个观测值后的灵敏度分析显示,学习动机对学业成绩的回归系数(beta = .39)与全样本结果(beta = .41)无实质性差异,主要结论稳健,故以下报告保留全样本结果(Cook,1977)。


七、在 ChatSRS 一句话完成影响力诊断

打开 chatsrs.com,上传数据后输入:

"对[因变量]和[自变量列表]做多元线性回归,先做完整的影响力诊断:计算所有观测值的 Cook 距离(用 4/n 判断标准)、帽子矩阵杠杆值(用 2p/n 判断标准)和内部学生化残差(|r*|>3 标准),列出超过阈值的观测,并做灵敏度分析(分别报告含与不含强影响点的回归结果)。输出符合 APA 7th 格式的方法章节描述和结果报告段落。"

ChatSRS 会自动完成以下步骤并输出论文格式报告:

  1. OLS 回归 + 帽子矩阵计算
  2. 三指标全量输出(含图表:Cook's D 逐观测图、残差vs杠杆散点图)
  3. 强影响点标记与灵敏度分析
  4. APA 7th 格式方法章节 + 结果报告段落(含参考文献格式)

八、处置强影响点的论文写法

识别出强影响点后,有三种处置方式,每种都需要在论文中交代:

方式一:保留并做灵敏度分析(最常见)

适用:强影响点并非数据错误,而是真实的极端观测(如特别高分的学生、特殊政策年份)。

方法章节:
"对所识别的 X 个强影响点(Cook's D > 4/n),以全样本和剔除强影响点后的
子样本分别进行回归分析,评估结果的稳健性(Cook,1977)。"

结果章节:
"灵敏度分析显示,剔除强影响点后主要系数估计[无实质变化 / 发生显著变化——
详见附录表X],本文最终报告基于全样本的结果,主要结论稳健。"

方式二:删去并说明(适用于明确数据错误)

方法章节:
"影响力诊断发现 X 个观测值存在数据录入错误(Cook's D 分别为 XX,
远超 4/n = XX 阈值),经核查原始问卷后确认为填写错误,予以删除。
最终分析基于 n = XX 个有效观测值。"

方式三:稳健回归(robust regression,高级处置)

适用:强影响点较多,或无法核查原始数据。改用 M 估计或 MM 估计等稳健回归方法,不删除数据但降低极端值权重。

"考虑到数据中存在多个强影响点(n_outlier = XX),采用 Huber M 估计稳健回归
(Huber, 1964)以减少强影响点对参数估计的干扰,结果报告稳健标准误。
作为稳健性检验,同时报告 OLS 结果(附录表X)。"

九、常见错误与 APA 格式细节

常见错误正确做法
Cook's D 用 1 作为唯一阈值,漏掉样本量中等时的影响观测首选 4/n,报告时说明 n 和阈值具体值
混淆"标准化残差"和"学生化残差",实为不同公式方法章节注明使用的是内部 / 外部学生化残差
只报告"未发现异常值",不报告最大 Cook's D 值报告最大值和阈值,让读者可重现判断
不做灵敏度分析就直接删掉强影响点保留分析或说明删去原因 + 主结论是否改变
杠杆值阈值写 0.5(固定值),不随 p/n 变化使用 2p/n 并代入具体 p 和 n
方法章节无参考文献引用 Cook(1977)、Hoaglin & Welsch(1978)

常见 FAQ

Q:Cook's D 用 4/n 还是 1 哪个更权威?

A:两个标准都来自统计文献,各有适用场景。4/n 是现代应用统计中更为普遍的初步筛查阈值,优点在于随样本量自动调整——样本越大,识别阈值越低,符合"大样本中即使较小的影响也值得关注"的逻辑。阈值 1 源于 Cook(1977)将 D_i 与 F 分布关联时的讨论,在实际数据中很少被超越,更适合作为"极端异常"的最终确认标准。建议:方法章节写"以 Cook's D > 4/n 作为初步筛查阈值,对超过 1.0 的观测作为高度异常处理",两者并用最为稳妥。

Q:高杠杆点一定是问题吗?必须删除吗?

A:不一定。高杠杆点只说明该观测在自变量空间处于边缘位置,不代表其回归关系错误。若该观测的实际 Y 值与基于其他数据预测的 Y 值吻合(残差小),则它是"好的高杠杆点"——反而帮助模型更精确地确定斜率。只有当高杠杆点同时具有大残差(即 Y 值偏离模型预测),才会导致高 Cook's D 并实质影响系数估计。识别后做灵敏度分析,而不是直接删除。

Q:标准化残差绝对值大于 2 和大于 3,哪个是标准?

A:两个阈值均有文献依据,含义不同。|r*| > 2 对应正态分布 95% 置信区间之外(约 5% 的观测即使在正常数据中也会超过),适合大样本初步筛查,但误报率较高;|r*| > 3 对应 99.7% 置信区间(正常数据约 0.3% 超过),误报率低,更常作为"确定异常值"的标准。论文中建议写明所用阈值,如"以内部学生化残差绝对值超过 3 作为异常值的识别标准(Tabachnick & Fidell,2013)"。

Q:Cook's D、DFFITS、DFBETAS 三个都要报告吗?

A:大多数论文只报告 Cook's D,因为它综合了所有系数的整体影响力,结果最直观。DFFITS 与 Cook's D 密切相关(两者高度相关),一般只选一个报告。DFBETAS 用于追踪某一个特定自变量系数受哪些观测影响最大,适合在对某个关键变量的系数估计产生质疑时深入检查。常见报告策略:方法章节说明同时计算了 Cook's D 和杠杆值,结果章节只展示 Cook's D,附录可补 DFFITS 或 DFBETAS 供审稿人核查。


快速参考:影响力诊断指标速查卡

[Cook's D — 强影响点综合指标]
D_i > 4/n         初步筛查(推荐)
D_i > 1           严格标准(极少见)
D_i > 4/(n-p-1)   小样本严格版

[杠杆值 h_ii — 自变量空间极端性]
h_ii > 2p/n       常用阈值(Hoaglin & Welsch, 1978)
h_ii > 3p/n       更保守阈值
h_ii > 0.5        固定绝对阈值(Chatterjee & Hadi, 2006)

[内部学生化残差 r* — 因变量异常性]
|r*| > 2           大样本初步筛查
|r*| > 3           确认异常值

[外部学生化残差 t_i — 精确假设检验]
|t_i| > t_0.025/n,n-p-1  Bonferroni 校正后的显著阈值

[综合判断]
高D + 高h + 高|r*|  → 强影响点,必须处置
高D + 高h + 低|r*|  → 影响模型形状,做灵敏度分析
低D + 低h + 高|r*|  → 异常值,但影响力有限,可保留说明
三者均低            → 正常观测,无需干预

相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。