教程 ·

工具变量回归(2SLS)用 AI 一句话完成 — 内生性检验、弱 IV 诊断、过度识别全攻略

工具变量回归(IV/2SLS)完整教程:用 AI 一句话完成两阶段最小二乘,自动输出弱工具变量 F 检验(Staiger-Stock / Stock-Yogo 阈值)、Hausman 内生性检验、Sargan-Hansen 过度识别检验,并给出符合 APA 7th 格式的论文报告模板。

OLS 系数被内生性偏倚?导师问"弱工具变量 F 值多少"——这篇文章教你用 AI 一句话跑完 2SLS 全套流程:Hausman 检验、弱 IV F 统计量(Stock-Yogo 临界值)、Sargan-Hansen 过度识别检验,60 秒齐。


为什么 OLS 系数不可信——内生性问题

在社会科学、经济学和公共卫生研究里,最常见的因果推断陷阱就是内生性(Endogeneity)。出现以下任一情形,OLS 估计量就有偏且不一致:

  • 遗漏变量偏倚(Omitted Variable Bias):无法观测的混杂因素同时影响自变量和因变量
  • 逆向因果(Reverse Causality):X 影响 Y,但 Y 也影响 X(双向因果)
  • 测量误差(Measurement Error):自变量存在经典测量误差时,OLS 估计量向零偏倚(衰减偏倚)

典型例子

  • 教育年限对收入的因果效应(更聪明的人既受教育更多也赚得更多——遗漏变量:先天能力)
  • 医疗支出对健康结局的效应(病情越重医疗支出越高——逆向因果)
  • 广告投入对销售额的影响(企业在预期销售好时加大广告——逆向因果)

**工具变量(Instrumental Variable,IV)**正是解决内生性的标准工具:找到一个仅通过内生变量影响结局的外生变量,用它"净化"内生变量中的内生成分,从而还原无偏的因果系数。

chatsrs.com 把从内生性检验到最终 2SLS 报告的全部流程压到一句话。


工具变量的两个核心条件

一个好的工具变量必须同时满足:

条件技术名称含义如何检验
相关性(Relevance)工具强度IV 与内生变量显著相关第一阶段 F 统计量 > 10(弱 IV 诊断)
外生性(Exogeneity)排他性限制IV 仅通过内生变量影响因变量,与误差项无关过度识别检验(仅当工具数 > 内生变量数时可检验)

相关性可以通过数据检验;外生性在恰好识别(工具数 = 内生变量数)时无法被数据检验,只能依赖研究设计与理论论证。


两阶段最小二乘(2SLS)的原理

2SLS 将估计分为两步:

第一阶段:用工具变量(和外生控制变量)对内生变量回归,得到内生变量的拟合值

X_hat = pi_0 + pi_1 * Z + pi_2 * W + v

其中 Z 是工具变量,W 是外生控制变量,X_hat 是净化后的内生变量(已去除内生成分)。

第二阶段:用 X_hat 替代原始 X 代入结构方程

Y = beta_0 + beta_1 * X_hat + beta_2 * W + epsilon

beta_1 即为内生性校正后的因果效应估计量,也称局部平均处理效应(Local Average Treatment Effect,LATE)(在 Angrist & Imbens 框架下,对"顺从者"的 ATE)。

与 OLS 的本质区别:OLS 最小化 Y 与 X 之间的残差平方和;2SLS 则先用工具净化 X,再做回归,代价是标准误变大(效率损失),换来的是无偏性。因此,2SLS 系数的置信区间通常宽于对应的 OLS 结果——这不是问题,而是诚实估计的代价。


案例数据:义务教育年限对劳动收入的因果效应

研究背景

复刻 Angrist & Krueger(1991)经典设计的简化版本:用出生季度(Q1/Q2/Q3/Q4)作为受教育年限的工具变量。

  • 内生变量(X):受教育年限(educ,年)
  • 因变量(Y):对数月收入(log_wage)
  • 工具变量(Z):出生季度虚拟变量(birth_q2、birth_q3、birth_q4,以 Q1 为参照)
  • 控制变量(W):工作经验(exper)、经验平方(exper_sq)、婚姻状况(married)、居住地区(region 虚拟变量)

识别逻辑:义务教育法规定年满 16 岁方可辍学。Q1 出生者(1 月3 月)恰好在 16 岁后入读高年级,法律约束较弱,辍学率更高,受教育年限更短;Q4 出生者(10 月12 月)在 16 岁时仍在高一,受法律约束更强,平均多读数月。出生季度影响收入仅通过教育年限,本身与个人能力无关——满足排他性。

数据共 3,010 名 25-65 岁男性,来自虚拟化的美国人口调查微数据。


用 AI 一句话完成 2SLS

登录 ChatSRS并上传数据后输入:

"以 log_wage 为因变量,educ 为内生变量(自变量),birth_q2、birth_q3、birth_q4 为工具变量,exper、exper_sq、married 以及 region 虚拟变量为外生控制变量,做两阶段最小二乘(2SLS)工具变量回归。 请输出:

  1. OLS 和 2SLS 系数对比表(含 beta、SE、t/z、p、95% CI)
  2. 第一阶段回归结果(F 统计量 + Stock-Yogo 弱 IV 临界值对比)
  3. Hausman 内生性检验(原假设:educ 外生)
  4. Sargan-Hansen 过度识别检验(J 统计量 + p 值)
  5. APA 格式中文文字描述"

60 秒后,ChatSRS 完整输出以下五部分结果。


输出结果怎么读

输出 1: OLS vs 2SLS 系数对比

表 1  教育年限对对数月收入影响的 OLS 与 2SLS 估计对比(N = 3,010)

                        OLS                     2SLS
变量              beta    SE      p         beta    SE      p
受教育年限(年)  0.062   0.003   <.001     0.089   0.021   <.001
工作经验(年)    0.041   0.004   <.001     0.039   0.005   <.001
经验平方(/100)  -0.051  0.007   <.001     -0.048  0.008   <.001
婚姻(已婚)      0.213   0.018   <.001     0.198   0.020   <.001
截距              4.562   0.074   <.001     4.431   0.112   <.001

注:region 虚拟变量系数省略。OLS R^2 = .267;2SLS 为过度识别(3 工具,df=2),与 LIML 仅在恰好识别时等价,此处为标准 2SLS 估计。
   * p < .05,** p < .01,*** p < .001

解读要点

  • OLS 教育年限系数 beta = 0.062,意味着多受 1 年教育,月收入提高约 6.2%(OLS,未纠正内生性)
  • 2SLS 系数 beta = 0.089,提示 OLS 低估了约 30%(衰减偏倚 + 遗漏能力变量导致的向下偏倚)
  • 2SLS 标准误(SE = 0.021)远大于 OLS(SE = 0.003),这是 IV 估计效率损失的正常体现
  • 后续 Hausman 检验将告诉我们这个差异是否在统计上显著

输出 2: 第一阶段 F 检验(弱 IV 诊断)

第一阶段回归:因变量 = educ(受教育年限)

工具变量                 beta    SE      t       p
birth_q2(vs Q1)        0.128   0.061   2.10    .036 *
birth_q3(vs Q1)        0.161   0.059   2.73    .006 **
birth_q4(vs Q1)        0.192   0.058   3.31    .001 ***

第一阶段联合 F 统计量(工具变量联合显著性):
  F(3, 2998) = 13.27,p < .001

Stock-Yogo 弱 IV 临界值(3 个工具,OLS 相对偏倚 <= 10%):
  临界值 F = 13.91(10% 偏倚水平)
  临界值 F = 9.08(15% 偏倚水平)
  临界值 F = 6.46(20% 偏倚水平)

结论:F = 13.27,超过 15% 偏倚临界值(9.08),未达 10% 偏倚临界值(13.91)。
      按传统 Staiger-Stock(1997)F > 10 经验法则,工具强度勉强达标;
      建议报告 Stock-Yogo 临界值并作坦诚讨论。

核心概念详解——弱工具变量诊断

弱工具变量(Weak Instruments)问题是 IV 估计中最常见的陷阱。当工具与内生变量的相关性不足时:

如果你已经跑出结果,但不知道“不显著”发生在第一阶段、第二阶段还是内生性检验,请先看工具变量不显著怎么办:四步诊断,再决定该报告什么、还缺什么证据。

  1. 2SLS 系数向 OLS 偏倚,无法有效纠正内生性
  2. 置信区间覆盖率下降,t 检验失效
  3. F 统计量的常用诊断标准有两套:
标准来源临界值适用场景
Staiger-Stock 经验法则Staiger & Stock (1997)F > 10恰好识别(1 个工具 vs 1 个内生变量)的简便判断
Stock-Yogo 精确临界值Stock & Yogo (2005)随工具数和偏倚容忍度变化过度识别场景,需查表

ChatSRS 说明:软件同时输出两套标准的结果,当两套结论存在分歧时(如本例),报告中应明确使用哪套标准并说明理由。AER、RESTAT 等顶刊现普遍要求使用 Stock-Yogo 精确临界值。


输出 3: Hausman 内生性检验

Hausman 内生性检验

原假设 H0:educ 外生(OLS 与 2SLS 无显著差异)
备择假设 H1:educ 内生(2SLS 系数与 OLS 系数存在显著差异)

Wu-Hausman F 检验:F(1, 2998) = 4.83,p = .028
Durbin-Wu-Hausman chi-squared 检验:chi-squared(1) = 4.81,p = .028

结论:p = .028 < .05,拒绝 H0,educ 存在显著内生性。2SLS 优于 OLS。

怎么读

Hausman 检验通过比较 OLS 和 2SLS 系数的差异来判断内生性是否显著:

  • p > .05:不能拒绝外生性,OLS 可行(更有效率)
  • p < .05:拒绝外生性,存在内生性,应使用 2SLS

本例 p = .028,统计显著,证实 educ 存在内生性,2SLS 是必要的。

重要提示:Hausman 检验本身也依赖工具变量的外生性假设。若工具本身不外生,Hausman 检验无效。因此,工具外生性的理论论证先于检验本身。


输出 4: Sargan-Hansen 过度识别检验

Sargan-Hansen 过度识别检验(J 检验)

原假设 H0:所有工具变量均外生(排他性限制成立)
备择假设 H1:至少一个工具变量不外生

工具数:3(birth_q2, birth_q3, birth_q4)
内生变量数:1(educ)
过度识别约束数:3 - 1 = 2

J 统计量:3.18,df = 2,p = .204

结论:p = .204 > .05,不能拒绝 H0。
     在统计意义上,3 个工具变量的排他性限制不被数据拒绝。

怎么读

过度识别检验(Overidentification Test)仅在工具变量数 > 内生变量数时可执行。它检验的是:多余的工具变量是否与结构方程的残差不相关——若相关,说明至少有一个工具不满足排他性。

结果含义
p > .05(不能拒绝 H0)数据不拒绝所有工具外生,工具有效性获得统计支持
p < .05(拒绝 H0)至少一个工具可能违反排他性,需重新审视识别策略

关键局限性:过度识别检验无法检验恰好识别(exactly identified)情形——当工具数 = 内生变量数时,J 统计量不存在,工具外生性仅能靠理论和研究设计论证,无法被数据证伪。


论文里怎么报告(APA 7th 格式)

方法节写法

为检验受教育年限(educ)对对数月收入(log_wage)的因果效应并纠正潜在内生性,采用两阶段最小二乘估计(Two-Stage Least Squares,2SLS)。以出生季度虚拟变量(birth_q2、birth_q3、birth_q4,以第一季度为参照)作为工具变量,参照 Angrist 与 Krueger(1991)的识别策略。工作经验、经验平方、婚姻状态及地区虚拟变量作为外生控制变量纳入两阶段。弱工具变量诊断依据 Stock 与 Yogo(2005)提供的精确临界值。内生性检验采用 Wu-Hausman 检验,过度识别检验采用 Sargan-Hansen J 检验。统计分析以 R 4.4(ivreg 包)实施,检验水准 alpha = .05(双尾)。

结果节写法

第一阶段回归显示,出生季度工具变量对受教育年限具有显著联合预测力,F(3, 2998) = 13.27, p < .001。依据 Stock 与 Yogo(2005)标准,F 统计量超过 15% 最大偏倚水平对应的临界值(9.08),但略低于 10% 偏倚临界值(13.91),提示工具具有中等强度,分析结果宜谨慎解读。

Wu-Hausman 内生性检验结果显示,受教育年限存在显著内生性,F(1, 2998) = 4.83, p = .028,支持使用 2SLS 估计。Sargan-Hansen 过度识别检验表明所有工具变量的排他性约束不被数据拒绝,J(2) = 3.18, p = .204。

2SLS 估计结果显示,在控制工作经验、婚姻状态和地区的条件下,受教育年限对对数月收入具有显著正向因果效应,beta = 0.089, SE = 0.021, z = 4.24, p < .001, 95% CI [0.048, 0.130],即教育年限每增加 1 年,月收入提升约 8.9%(指数化后)。OLS 对应系数为 beta = 0.062, SE = 0.003, p < .001,2SLS 系数约高出 OLS 43.5%,与内生性导致 OLS 衰减偏倚的预期方向一致。


报告格式规范总结

要素APA 格式示例
第一阶段 FF(3, 2998) = 13.27, p < .001
Wu-Hausman 检验F(1, 2998) = 4.83, p = .028
Sargan-Hansen JJ(2) = 3.18, p = .204
2SLS 系数beta = 0.089, SE = 0.021, 95% CI [0.048, 0.130]
z 统计量z = 4.24, p < .001
Stock-Yogo 临界值引用Stock & Yogo (2005)

APA 细节提醒

  • p 值小数点前不加 0(写 p = .028,不写 p = 0.028)
  • 95% CI 用方括号 [ ]
  • 2SLS 系数对应的检验统计量是 z(大样本渐进正态),而非 t
  • 引用 Staiger & Stock(1997)或 Stock & Yogo(2005)时需进参考文献列表

常见问题 FAQ

Q1:F > 10 一定说明工具足够强吗?

A:F > 10 是 Staiger 与 Stock(1997)针对单一工具、恰好识别情形提出的经验法则,其对应的 OLS 相对偏倚上限约为 10%。当工具变量数量增加(过度识别),或对偏倚容忍度更严格时,应使用 Stock 与 Yogo(2005)提供的精确临界值表——临界值会随工具数和偏倚容忍水平变化。例如,3 个工具、10% 偏倚水平的临界值为 13.91,高于传统的 10。ChatSRS 同时输出两套标准并给出比对结论,无需手动查表。

Q2:Hausman 检验通过(p > .05)还需要汇报 2SLS 吗?

A:若 Hausman 检验不显著(不能拒绝外生性假设,即 H0:变量外生),OLS 在效率上优于 2SLS,通常以 OLS 为主要报告结果。但在以下情形仍建议同时报告 2SLS 作为稳健性检验:(1) 研究问题具有强烈的内生性先验(如随机对照难以实现的因果问题);(2) 样本量有限导致 Hausman 检验功效不足;(3) 期刊审稿人或领域规范要求汇报工具变量估计。ChatSRS 可在同一指令中同时输出 OLS + 2SLS 对比表,方便按需选择报告口径。

Q3:恰好识别(1 个工具 vs 1 个内生变量)时,过度识别检验为什么做不了?

A:Sargan-Hansen J 检验的原理是用"多余的"工具变量来检验整体工具集的外生性——即将过度识别的约束数(工具数 - 内生变量数)作为检验的自由度。当两者数量相等时,约束数为 0,J 统计量不存在。此时工具的外生性无法被数据证伪,只能通过以下途径提供证据:(1) 理论论证识别策略的合理性;(2) 引用已有文献中对同类工具的外生性论证;(3) 进行敏感性分析(如 Andrews, Gentzkow & Shapiro 2017 的局部外生性检验)。

Q4:2SLS 系数比 OLS 大,一定说明 OLS 是向下偏倚的吗?

A:不一定。2SLS 与 OLS 的差异方向取决于内生性的来源。遗漏正向能力变量(如"聪明"对教育和收入均有正向影响)会导致 OLS 高估 beta(正向混杂偏倚);测量误差(经典衰减偏倚)和逆向因果(如重病者医疗支出高但健康差)则可能导致 OLS 低估 beta。在教育年限案例中,学界普遍认为 OLS 同时存在向上偏倚(能力偏倚)和向下偏倚(测量误差),净效应方向取决于哪种机制占主导,需结合研究背景判断,不可机械套用。

Q5:工具变量估计的 LATE 和 ATE 有什么区别?

A:在 Angrist 与 Imbens(1994)潜在结果框架下,IV 在异质性处理效应情形下识别的是局部平均处理效应(LATE,Local Average Treatment Effect),即针对"顺从者(Compliers)"——那些因工具变量取值而改变处理状态的个体——的平均因果效应。LATE 不等于整体平均处理效应(ATE),也不等于处理组平均处理效应(ATT)。报告时需注意:2SLS 的外推范围仅限于顺从者群体,在报告结论时应回避"所有人的教育回报为 X%"的绝对表述,应说明"在受出生季度法律约束影响教育年限的群体中"。


小结

工具变量回归(IV/2SLS)是处理内生性问题的计量经济学标准方案,实施难点集中在三处:

  1. 工具强度诊断不能只看 F > 10——应同时对照 Stock-Yogo 精确临界值,并说明采用哪套标准
  2. 内生性检验 + 过度识别检验缺一不可——Hausman 确认用 2SLS 的必要性,Sargan-Hansen 验证工具外生性(过度识别情形)
  3. APA 报告须同时呈现 OLS 与 2SLS 对比——让读者看到内生性纠正带来的系数变化,并正确书写 z 统计量和 CI 的括号格式

chatsrs.com 把全部流程压到一句话,三引擎(SPSS + R + Stata)自动输出第一阶段 F 检验、Hausman 检验、Sargan-Hansen 检验、两阶段系数对比三线表,并生成可直接贴进论文的 APA 7th 中文描述。


相关阅读


本文首发于 ChatSRS 官方博客。如有问题或反馈,欢迎在 ChatSRS 站内 [用户中心 -> 帮助与反馈] 联系我们。