统计百科 ·
Cook距离和杠杆值怎么识别回归强影响点?— Cook's D、杠杆值、标准化残差诊断完全指南
统计百科:系统讲解Cook距离(Cook's D>4/n判断标准)、帽子矩阵杠杆值(h_ii>2p/n)、标准化残差与学生化残差的区别,以及如何综合三类指标识别线性回归中的强影响点、高杠杆点和异常值,附APA 7th报告模板。
回归模型跑出来了,R² 挺高,但某几个观测值一旦删掉,系数估计就大幅变动——这就是强影响点(influential observation)在作怪。识别它们靠三把尺子:Cook距离(整体影响力)、杠杆值(自变量空间异常性)和标准化残差(因变量异常性)。三者含义不同,不能互相替代,组合使用才能完整诊断。本文逐一拆解每个指标的计算逻辑、判断标准与 APA 7th 报告写法。
你的回归分析有这些困惑吗?
导师或审稿人常见反馈:
- "Cook距离的判断标准到底是 1 还是 4/n?两种说法都见过"
- "杠杆值和Cook距离有什么区别,高杠杆点一定是强影响点吗?"
- "标准化残差和学生化残差(studentized residual)是同一个指标吗?"
- "方法章节要不要说明如何处理强影响点?"
- "删掉异常点还是保留,论文里怎么交代才不会被审稿人质疑?"
这些问题集中在**回归影响分析(regression influence diagnostics)**这一领域。本文只讲一件事:三类诊断指标分别是什么、怎么用、APA 7th 怎么报告。
如果你还没看过姊妹篇 多元线性回归完整教程,建议先读那篇了解基础回归框架,本文默认你已知道 OLS 估计和残差的基本概念。
一、三类诊断指标的逻辑定位
在识别"问题观测值"时,统计学区分了三种不同含义的异常:
| 类型 | 核心问题 | 主要指标 |
|---|---|---|
| 异常值(outlier) | 因变量 Y 偏离预测值有多远? | 标准化残差、学生化残差 |
| 高杠杆点(high-leverage point) | 观测值在自变量空间是否处于极端位置? | 杠杆值 h_ii(帽子矩阵对角元) |
| 强影响点(influential observation) | 删掉该观测后,回归系数估计变化有多大? | Cook's D、DFFITS、DFBETAS |
三者关系如下:
- 高杠杆点 + 大残差 = 几乎必然是强影响点
- 高杠杆点 + 小残差 = 可能是"好的高杠杆点",对模型拟合有益
- 低杠杆点 + 大残差 = 异常值,但对系数估计影响不一定大
- Cook's D 是杠杆值和残差的综合函数,直接量化影响力
二、Cook距离(Cook's D)
计算公式与直觉含义
Cook(1977)提出的影响力指标,核心思想是:删掉第 i 个观测后,所有预测值的变化有多大?
$D_i = \frac{\sum_{j=1}^{n}(\hat{y}j - \hat{y}{j(i)})^2}{p \cdot MSE}$
其中:
- $\hat{y}_j$ = 使用全样本估计的第 j 个预测值
- $\hat{y}_{j(i)}$ = 删去第 i 个观测后重新估计的第 j 个预测值
- $p$ = 模型参数个数(含截距)
- $MSE$ = 均方误差
等价表达形式(更便于理解):
$D_i = \frac{e_i^2}{p \cdot MSE} \cdot \frac{h_{ii}}{(1 - h_{ii})^2}$
这个形式揭示了 Cook's D = 残差的贡献 × 杠杆值的贡献。无论哪一个极端,都会抬高 D_i。
判断标准:4/n 还是 1?
实践中最广泛使用的标准是 $D_i > 4/n$(n 为样本量),这是更保守(更敏感)的筛查阈值:
| 标准 | 含义 | 适用场合 |
|---|---|---|
| $D_i > 4/n$ | 相对于平均水平偏高的影响力 | 样本量中等到大(n >= 30),初步筛查,论文推荐 |
| $D_i > 1$ | 影响力达到 F 分布临界值附近 | 传统严格标准,实际很少超越,常用于最终判断 |
| $D_i > 4/(n-p-1)$ | Fox(2016)修正版 | 小样本下的严格检验 |
为什么论文中更多见 4/n 而非 1?
当 n = 200,4/n = 0.02;当 n = 50,4/n = 0.08。与样本量成反比,能自动适应"大样本时即使 D_i = 0.15 也可能很异常"的情形。阈值为 1 时,只有极少数观测(通常是数据录入错误或极端值)才会超过,容易漏掉真正有影响的观测。
APA 7th 报告写法:论文方法章节应说明使用了哪个标准,结果章节报告被识别的观测数量。
Cook's D 的分布参考
Cook(1977)建议以 $F(p, n-p)$ 分布的百分位数作为参照基准来评估 $D_i$ 的大小,而非声称 $D_i$ 的抽样分布本身服从 F 分布。若 $D_i$ 对应的 F 分布累积概率超过 0.50(即 $D_i > F_{0.50, p, n-p}$ 的中位数),则该观测的影响力已超过半数 F 分布参照值,值得关注;超过 0.80 则高度警示。
但在实际写论文时,直接用 4/n 阈值更直观,也更常见于心理学和社会科学期刊。
三、杠杆值(Leverage)
帽子矩阵与 h_ii
杠杆值 $h_{ii}$ 来自帽子矩阵(hat matrix)$\mathbf{H}$:
$\mathbf{H} = \mathbf{X}(\mathbf{X}^T\mathbf{X})^{-1}\mathbf{X}^T$
$\hat{\mathbf{y}} = \mathbf{H}\mathbf{y} \quad \Rightarrow \quad \text{"H 把 y 变成 } \hat{y}\text{",故称帽子矩阵}$
$h_{ii}$ 是矩阵 H 的第 i 个对角元,取值范围为 $[1/n,\ 1]$:
- $h_{ii} = 1/n$:第 i 个观测在自变量空间最"普通",影响力最低
- $h_{ii} \to 1$:第 i 个观测对自身预测值完全决定,有点像"自我实现"
- $\bar{h} = p/n$(所有杠杆值的均值),p 为参数个数含截距
杠杆值衡量的是自变量空间的极端性,与 Y 值无关。
判断标准
广泛使用的阈值:$h_{ii} > 2p/n$(或 $3p/n$ 用于更保守标准)
| 标准 | 说明 |
|---|---|
| $h_{ii} > 2p/n$ | Hoaglin & Welsch(1978)推荐的常用阈值 |
| $h_{ii} > 3p/n$ | 更保守,减少误报 |
| $h_{ii} > 0.5$ | Chatterjee & Hadi(2006)建议的绝对阈值 |
例如:5 个预测变量 + 截距(p = 6),N = 200,则 $2p/n = 12/200 = 0.06$,超过 0.06 的观测被标记为高杠杆点。
杠杆值和 Cook's D 的关系
如前述公式所示,Cook's D 包含 $h_{ii}/(1-h_{ii})^2$ 这一项。当 $h_{ii} \to 1$ 时,该项趋向无穷大,即使残差不大,Cook's D 也会很高。这就是为什么高杠杆点即使预测值精准,也应引起重视——它们"塑造"了回归平面本身。
四、标准化残差与学生化残差
区别汇总
| 指标 | 公式 | 特点 | 判断阈值 |
|---|---|---|---|
| 原始残差 | $e_i = y_i - \hat{y}_i$ | 量纲依赖数据,难以比较 | — |
| 标准化残差(standardized residual) | $r_i = e_i / \sqrt{MSE}$ | 近似标准正态,但忽略了杠杆值的影响 | $|r_i| > 2$ 或 gt; 3$ |
| 内部学生化残差(internally studentized) | $r_i^* = e_i / \sqrt{MSE(1-h_{ii})}$ | 考虑杠杆值,比标准化更准确;大多数软件"标准化残差"实际是此项 | $|r_i^*| > 2$ 或 gt; 3$ |
| 外部学生化残差(externally studentized / studentized deleted residual) | $t_i = e_i / \sqrt{MSE_{(i)}(1-h_{ii})}$ | 删去第 i 个观测后重新估计 MSE,服从 t(n-p-1) 分布,最严格 | $|t_i| > t_{0.025, n-p-1}$(Bonferroni 校正) |
论文方法章节建议说明使用的是哪种残差,尤其要区分"标准化残差"(standardized residual)和"学生化残差"(studentized residual),二者在中文文献中常被混用。
Bonferroni 校正的外部学生化残差
多重比较问题:n 个观测同时检验时,需将 p 值阈值除以 n(Bonferroni 校正):
$|t_i| > t_{0.025/n,\ n-p-1}$
例:n = 200,p = 6,则阈值为 $t_{0.025/200,\ 193} = t_{0.000125,\ 193} \approx 3.88$
此时 $|t_i| > 3.88$ 才被判定为显著异常值(控制 FWER < .05)。
五、综合诊断:三指标联合判断
单一指标可能误判,推荐三指标联合的决策树:
第一步:检查标准化残差(|r*| > 3)→ 识别因变量异常值
第二步:检查杠杆值(h_ii > 2p/n)→ 识别自变量空间极端点
第三步:检查 Cook's D(D_i > 4/n)→ 识别强影响点
综合判断:
高残差 + 高杠杆 + 高 D → 高优先级强影响点,必须处置
高杠杆 + 低残差 + 中等D → "好的"高杠杆点,一般保留
高残差 + 低杠杆 + 低D → 异常值,对系数影响小,可保留并说明
三者均低 → 正常观测
附加指标(较复杂设计时使用):
- DFFITS:删去第 i 个观测后第 i 个预测值的标准化变化,阈值 $|DFFITS_i| > 2\sqrt{p/n}$
- DFBETAS:删去第 i 个观测后第 j 个回归系数的标准化变化,阈值 $|DFBETAS_{ij}| > 2/\sqrt{n}$
- Mahalanobis 距离:多变量版本的杠杆值,检验 X 向量整体是否异常
六、完整 APA 7th 报告模板
方法章节描述模板
在执行多元线性回归分析前,对所有观测值进行影响力诊断。
以 Cook 距离(Cook's D > 4/n)识别强影响点,以帽子矩阵对角元
(h_ii > 2p/n)识别高杠杆点,以内部学生化残差(|r*| > 3)识别
异常值(Hoaglin & Welsch,1978;Cook,1977)。
对被识别的观测值,通过灵敏度分析(将其纳入与剔除后分别报告回归结果)
评估其对主要结论的影响。
结果章节报告模板(有强影响点)
影响力诊断显示,X 个观测值的 Cook 距离超过 4/n 阈值(D_i 范围 = [XX, XX]),
其中 X 个同时表现出高杠杆值(h_ii > 2p/n)和大标准化残差(|r*| > 3),
提示为强影响点。灵敏度分析表明,删去该 X 个观测后,[变量名] 的回归系数由
beta = .XX 变化为 beta = .XX,[主要结论未实质改变 / 结论发生变化,以下报告
删去强影响点后的结果]。最终分析基于 n = [XX] 个观测值进行(Cook,1977)。
结果章节报告模板(无强影响点)
影响力诊断未发现 Cook 距离超过 4/n 阈值(最大 D_i = X.XX)或高杠杆值
(最大 h_ii = X.XX,阈值 2p/n = X.XX)的观测值,全部 N = [XX] 个观测值
均保留于最终分析中。
可直接抄进论文的 APA 报告句式
回归影响力诊断显示,3 个观测值的 Cook 距离超过 4/n 阈值(D_i = 0.043、0.051 和 0.068,阈值 = 0.020),且均具有较高杠杆值(h_ii = 0.14、0.19 和 0.22,阈值 2p/n = 0.12)和较大标准化残差(|r*| = 3.2、2.8 和 3.7)。删去上述 3 个观测值后的灵敏度分析显示,学习动机对学业成绩的回归系数(beta = .39)与全样本结果(beta = .41)无实质性差异,主要结论稳健,故以下报告保留全样本结果(Cook,1977)。
七、在 ChatSRS 一句话完成影响力诊断
打开 chatsrs.com,上传数据后输入:
"对[因变量]和[自变量列表]做多元线性回归,先做完整的影响力诊断:计算所有观测值的 Cook 距离(用 4/n 判断标准)、帽子矩阵杠杆值(用 2p/n 判断标准)和内部学生化残差(|r*|>3 标准),列出超过阈值的观测,并做灵敏度分析(分别报告含与不含强影响点的回归结果)。输出符合 APA 7th 格式的方法章节描述和结果报告段落。"
ChatSRS 会自动完成以下步骤并输出论文格式报告:
- OLS 回归 + 帽子矩阵计算
- 三指标全量输出(含图表:Cook's D 逐观测图、残差vs杠杆散点图)
- 强影响点标记与灵敏度分析
- APA 7th 格式方法章节 + 结果报告段落(含参考文献格式)
八、处置强影响点的论文写法
识别出强影响点后,有三种处置方式,每种都需要在论文中交代:
方式一:保留并做灵敏度分析(最常见)
适用:强影响点并非数据错误,而是真实的极端观测(如特别高分的学生、特殊政策年份)。
方法章节:
"对所识别的 X 个强影响点(Cook's D > 4/n),以全样本和剔除强影响点后的
子样本分别进行回归分析,评估结果的稳健性(Cook,1977)。"
结果章节:
"灵敏度分析显示,剔除强影响点后主要系数估计[无实质变化 / 发生显著变化——
详见附录表X],本文最终报告基于全样本的结果,主要结论稳健。"
方式二:删去并说明(适用于明确数据错误)
方法章节:
"影响力诊断发现 X 个观测值存在数据录入错误(Cook's D 分别为 XX,
远超 4/n = XX 阈值),经核查原始问卷后确认为填写错误,予以删除。
最终分析基于 n = XX 个有效观测值。"
方式三:稳健回归(robust regression,高级处置)
适用:强影响点较多,或无法核查原始数据。改用 M 估计或 MM 估计等稳健回归方法,不删除数据但降低极端值权重。
"考虑到数据中存在多个强影响点(n_outlier = XX),采用 Huber M 估计稳健回归
(Huber, 1964)以减少强影响点对参数估计的干扰,结果报告稳健标准误。
作为稳健性检验,同时报告 OLS 结果(附录表X)。"
九、常见错误与 APA 格式细节
| 常见错误 | 正确做法 |
|---|---|
| Cook's D 用 1 作为唯一阈值,漏掉样本量中等时的影响观测 | 首选 4/n,报告时说明 n 和阈值具体值 |
| 混淆"标准化残差"和"学生化残差",实为不同公式 | 方法章节注明使用的是内部 / 外部学生化残差 |
| 只报告"未发现异常值",不报告最大 Cook's D 值 | 报告最大值和阈值,让读者可重现判断 |
| 不做灵敏度分析就直接删掉强影响点 | 保留分析或说明删去原因 + 主结论是否改变 |
| 杠杆值阈值写 0.5(固定值),不随 p/n 变化 | 使用 2p/n 并代入具体 p 和 n |
| 方法章节无参考文献 | 引用 Cook(1977)、Hoaglin & Welsch(1978) |
常见 FAQ
Q:Cook's D 用 4/n 还是 1 哪个更权威?
A:两个标准都来自统计文献,各有适用场景。4/n 是现代应用统计中更为普遍的初步筛查阈值,优点在于随样本量自动调整——样本越大,识别阈值越低,符合"大样本中即使较小的影响也值得关注"的逻辑。阈值 1 源于 Cook(1977)将 D_i 与 F 分布关联时的讨论,在实际数据中很少被超越,更适合作为"极端异常"的最终确认标准。建议:方法章节写"以 Cook's D > 4/n 作为初步筛查阈值,对超过 1.0 的观测作为高度异常处理",两者并用最为稳妥。
Q:高杠杆点一定是问题吗?必须删除吗?
A:不一定。高杠杆点只说明该观测在自变量空间处于边缘位置,不代表其回归关系错误。若该观测的实际 Y 值与基于其他数据预测的 Y 值吻合(残差小),则它是"好的高杠杆点"——反而帮助模型更精确地确定斜率。只有当高杠杆点同时具有大残差(即 Y 值偏离模型预测),才会导致高 Cook's D 并实质影响系数估计。识别后做灵敏度分析,而不是直接删除。
Q:标准化残差绝对值大于 2 和大于 3,哪个是标准?
A:两个阈值均有文献依据,含义不同。|r*| > 2 对应正态分布 95% 置信区间之外(约 5% 的观测即使在正常数据中也会超过),适合大样本初步筛查,但误报率较高;|r*| > 3 对应 99.7% 置信区间(正常数据约 0.3% 超过),误报率低,更常作为"确定异常值"的标准。论文中建议写明所用阈值,如"以内部学生化残差绝对值超过 3 作为异常值的识别标准(Tabachnick & Fidell,2013)"。
Q:Cook's D、DFFITS、DFBETAS 三个都要报告吗?
A:大多数论文只报告 Cook's D,因为它综合了所有系数的整体影响力,结果最直观。DFFITS 与 Cook's D 密切相关(两者高度相关),一般只选一个报告。DFBETAS 用于追踪某一个特定自变量系数受哪些观测影响最大,适合在对某个关键变量的系数估计产生质疑时深入检查。常见报告策略:方法章节说明同时计算了 Cook's D 和杠杆值,结果章节只展示 Cook's D,附录可补 DFFITS 或 DFBETAS 供审稿人核查。
快速参考:影响力诊断指标速查卡
[Cook's D — 强影响点综合指标]
D_i > 4/n 初步筛查(推荐)
D_i > 1 严格标准(极少见)
D_i > 4/(n-p-1) 小样本严格版
[杠杆值 h_ii — 自变量空间极端性]
h_ii > 2p/n 常用阈值(Hoaglin & Welsch, 1978)
h_ii > 3p/n 更保守阈值
h_ii > 0.5 固定绝对阈值(Chatterjee & Hadi, 2006)
[内部学生化残差 r* — 因变量异常性]
|r*| > 2 大样本初步筛查
|r*| > 3 确认异常值
[外部学生化残差 t_i — 精确假设检验]
|t_i| > t_0.025/n,n-p-1 Bonferroni 校正后的显著阈值
[综合判断]
高D + 高h + 高|r*| → 强影响点,必须处置
高D + 高h + 低|r*| → 影响模型形状,做灵敏度分析
低D + 低h + 高|r*| → 异常值,但影响力有限,可保留说明
三者均低 → 正常观测,无需干预
相关阅读
本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。