统计百科 ·

工具变量回归2SLS的APA报告怎么写?弱工具与过度识别检验格式全解

统计百科:专攻工具变量回归(2SLS)的APA 7th报告格式——第一阶段F检验弱工具判断、Sargan/Hansen过度识别检验写法、2SLS系数报告模板、方法章节标准描述,给出可直接套进论文的完整APA示例句式。

2SLS(两阶段最小二乘法)是处理内生性问题的核心工具,但它的APA报告格式在教材里几乎找不到——第一阶段F值写哪里、弱工具如何表述、过度识别检验怎么配合正文、系数要写几位小数……这篇文章专攻"工具变量回归结果怎么规范写进论文",给出APA 7th所有2SLS场景的完整模板,并逐一盘点审稿人最常挑的格式问题。


你的2SLS报告有这些问题吗?

审稿人或导师关于工具变量报告最常见的反馈:

  • "第一阶段F检验结果没有报告,无法判断工具变量强度"
  • "仅写'通过弱工具检验',请给出F统计量和临界值依据"
  • "过度识别检验未报告,reviewer要求补充Sargan或Hansen J检验"
  • "2SLS系数没有说明是经内生性校正后的估计,请在方法章节注明"
  • "工具变量有效性的理论论证缺失,统计检验不能代替理论说明"
  • "只报告了2SLS结果,建议同时报告OLS结果作为对比"

这些问题集中反映了一个事实:2SLS的APA报告不只是"把系数填进表格",还需要清楚展示内生性识别策略的可信度。本文只讲一件事:工具变量回归结果到底怎么规范写进论文的每一个位置

如果你还没看过姊妹篇 面板数据回归的APA报告写法,建议先读那篇,本文默认你已了解回归系数、标准误、p值不加前导零(.032而非0.032)等基础格式规则,不再重复。


一、为什么2SLS报告比OLS更复杂

内生性与识别策略

普通OLS回归报告相对简单:给出系数beta、标准误SE、t值、p值,加上模型整体F检验和R^2即可。

2SLS之所以复杂,在于它要多回答三个问题:

  1. 工具变量够强吗?(弱工具变量检验,First-stage F test)
  2. 工具变量外生吗?(过度识别检验,仅在工具数量 > 内生变量数量时可检验)
  3. 内生性真的存在吗?(Hausman/Wu-Hausman内生性检验)

这三个检验的结果都需要在论文中汇报,缺一不可。APA 7th没有专门的2SLS格式章节,但其推断统计报告的通用原则(精确统计量 + 效应量 + 可重复性)同样适用。

2SLS的两阶段逻辑

第一阶段(First Stage):用工具变量Z(和其他外生控制变量X)对内生变量D进行OLS回归,获得D的拟合值 D_hat。

$D = \pi_0 + \pi_1 Z + \pi_2 X + v$

第二阶段(Second Stage):用拟合值 D_hat 替代原始D,对结果变量Y进行回归。

$Y = \beta_0 + \beta_1 \hat{D} + \beta_2 X + \varepsilon$

最终报告的 beta_1 即为经内生性校正的因果效应估计。


二、第一阶段F检验:弱工具变量的判断与报告格式

为什么F检验是2SLS报告的必报项

第一阶段F检验检验的是工具变量对内生变量的预测力(相关性条件)。若F值过低,工具变量为"弱工具变量"(Weak Instrument),2SLS估计会出现严重偏差(接近OLS偏差),标准误膨胀,推断失效。

临界值标准

判断标准来源说明
F > 10(单个工具变量)Staiger & Stock(1997)经典经验法则,单个内生变量 + 单个工具变量
F > 10(多个工具变量)Stock & Yogo(2005)允许5%最大bias时的近似门槛
Effective F(KP rk Wald F)Kleibergen-Paap(2006)异方差/聚类SE下的稳健F统计量,推荐使用
F > 16.38(单变量单工具,size扭曲≤10%)Stock & Yogo(2005)精确临界值最大size扭曲10%对应16.38;最大相对bias 5%对应24.58

现代计量实践推荐使用Kleibergen-Paap rk Wald F统计量(简称KP F或rk F),因为它在异方差和聚类标准误下仍有效,而传统Cragg-Donald F仅在同方差下精确。

APA格式:第一阶段F检验的报告句式

嵌入正文段落时

第一阶段回归结果显示,[工具变量名]对[内生变量名]具有显著的预测作用,
Kleibergen-Paap rk Wald F = XX.XX(临界值 10,Staiger & Stock,1997),
满足工具变量相关性要求,不存在弱工具变量问题。

填入数值的示例

第一阶段回归结果显示,省级降雨量对农业机械化率具有显著的预测作用,Kleibergen-Paap rk Wald F = 34.27(临界值10,Staiger & Stock,1997),远超弱工具变量经验门槛,满足工具变量相关性要求。

若F偏低,需说明处理方式

第一阶段Kleibergen-Paap rk Wald F = 7.82,低于Stock & Yogo(2005)弱工具临界值。为此,本研究同时报告了Anderson-Rubin置信集(AR CI)以获得在弱工具条件下稳健的推断,并汇报了LIML(有限信息最大似然)估计作为稳健性检验。


三、过度识别检验:Sargan/Hansen J检验的格式

什么时候需要过度识别检验

  • 恰好识别(工具变量数 = 内生变量数):无法检验外生性,只能依赖理论论证。
  • 过度识别(工具变量数 > 内生变量数):可以用Sargan检验(同方差下)或Hansen J检验(异方差稳健)检验工具变量外生性的联合假设。

过度识别检验的零假设是:所有工具变量均外生(与残差不相关)。因此:

  • p > .05(不显著):无法拒绝外生性假设,支持工具变量的有效性
  • p < .05(显著):至少有一个工具变量可能不满足外生性,需进一步说明

注意:过度识别检验不能直接"证明"工具变量外生——它只能在所有工具变量中至少有一个确实外生的前提下,联合检验其余工具变量的外生性。理论论证永远优先于统计检验。

APA格式:过度识别检验的报告句式

检验通过(p > .05)

Hansen J过度识别检验结果不显著,chi^2([工具数-内生数]) = X.XX, p = .XXX,
无法拒绝所有工具变量联合外生的零假设,支持工具变量组合的有效性。

填入数值的示例

Hansen J过度识别检验结果不显著,chi^2(2) = 1.84,p = .399,无法拒绝所有工具变量联合外生的零假设(Sargan,1958;Hansen,1982),支持本研究工具变量组合的有效性。

检验未通过(p < .05)

Hansen J过度识别检验结果显著,chi^2(2) = 6.31,p = .043,提示工具变量组合的联合外生性存疑。本研究进一步对每个工具变量进行分类讨论,并报告了仅使用第一个工具变量的恰好识别估计(点估计 beta = 0.32,SE = 0.07)作为稳健性检验,估计结果基本稳定。


四、Wu-Hausman内生性检验的格式

内生性检验用于判断是否真正需要使用IV(若OLS一致,则无需IV)。零假设是:内生变量实际上外生,OLS与2SLS无显著差异。

零假设不成立(需要IV)

Wu-Hausman内生性检验结果显著,F(1, [df]) = X.XX, p = .XXX,
拒绝[内生变量名]外生的零假设,证实存在内生性问题,
使用2SLS估计具有必要性。

填入数值的示例

Wu-Hausman内生性检验结果显著,F(1, 342) = 9.74,p = .002,拒绝教育年限外生的零假设,证实存在内生性问题,OLS估计不一致,使用2SLS估计具有必要性(Hausman,1978)。


五、2SLS系数的完整APA报告模板

必报要素清单

要素格式示例
2SLS系数(beta)b = X.XX 或 beta = X.XXb = 0.41
稳健标准误SE = X.XXSE = 0.09
t值或z值t(df) = X.XXt(342) = 4.56
p值(精确三位小数)p = .XXX 或 p < .001p < .001
95%置信区间95% CI [XX, XX]95% CI [0.23, 0.59]
第一阶段F(必报)KP F = XX.XXKP F = 34.27
过度识别检验(若过度识别)Hansen J chi^2(df) = X.XX, p = .XXXHansen J chi^2(2) = 1.84, p = .399
内生性检验(推荐)Wu-Hausman F(1, df) = X.XX, p = .XXXWu-Hausman F(1, 342) = 9.74, p = .002

场景一:单个内生变量 + 单个工具变量(恰好识别)

情形:研究教育年限(内生)对工资的影响,以父亲教育年限为工具变量,控制经验、性别,N = 500。

完整报告段落模板

采用两阶段最小二乘法(2SLS)估计[内生变量]对[因变量]的因果效应,
以[工具变量名]作为[内生变量名]的工具变量。
第一阶段结果显示,[工具变量]对[内生变量]具有显著的正向预测作用,
b = X.XX, SE = X.XX, t([df]) = X.XX, p [值],
Kleibergen-Paap rk Wald F = XX.XX,满足工具变量相关性要求(Stock & Yogo,2005)。
Wu-Hausman内生性检验结果显著,F(1, [df]) = X.XX, p [值],
证实[内生变量名]存在内生性,2SLS估计具有必要性。
2SLS第二阶段结果显示,在控制[控制变量列表]后,
[内生变量名]对[因变量名]具有显著的[正向/负向]效应,
b = X.XX(SE = X.XX),t([df]) = X.XX, p [值],95% CI [XX, XX]。
本研究使用HC2稳健标准误以应对异方差,所有报告系数均为未标准化系数。

填入数值的示例

采用两阶段最小二乘法(2SLS)估计教育年限对月工资对数的因果效应,以父亲教育年限作为教育年限的工具变量(Card,1995)。第一阶段结果显示,父亲教育年限对子女教育年限具有显著的正向预测作用,b = 0.32,SE = 0.04,t(496) = 8.00,p < .001,Kleibergen-Paap rk Wald F = 64.03,远超弱工具临界值10(Stock & Yogo,2005),工具变量相关性满足要求。Wu-Hausman内生性检验结果显著,F(1, 495) = 11.43,p < .001,证实教育年限存在内生性,OLS估计不一致,2SLS估计具有必要性。2SLS第二阶段结果显示,在控制工作经验年限和性别后,教育年限对月工资对数具有显著的正向效应,b = 0.092,SE = 0.019,t(496) = 4.84,p < .001,95% CI [0.055,0.129],即每增加1年教育,月工资约提升9.2%(经内生性校正)。相比之下,OLS估计为b = 0.071(SE = 0.008),低于2SLS估计,符合正向选择偏误的理论预期。本研究使用HC2稳健标准误以应对异方差,报告系数均为未标准化系数。

场景二:单个内生变量 + 多个工具变量(过度识别)

情形:研究制度质量(内生)对经济增长的影响,以地理纬度和殖民地历史为工具变量,N = 80个国家。

完整报告段落模板(含过度识别检验)

采用两阶段最小二乘法(2SLS)估计[内生变量]对[因变量]的效应,
以[工具变量1]和[工具变量2]共同作为[内生变量名]的工具变量。
第一阶段中,工具变量组合对[内生变量名]具有显著的联合预测力,
Kleibergen-Paap rk Wald F = XX.XX(临界值10,Stock & Yogo,2005)。
Hansen J过度识别检验结果不显著,chi^2(1) = X.XX, p = .XXX,
支持工具变量组合的联合外生性。
2SLS估计结果显示,[内生变量名]对[因变量名]的效应为
b = X.XX(SE = X.XX),p [值],95% CI [XX, XX]。

填入数值的示例

采用两阶段最小二乘法(2SLS)估计制度质量对人均GDP增长的因果效应,以绝对纬度和欧洲殖民者定居率(对数)共同作为制度质量的工具变量(Acemoglu等,2001)。第一阶段中,工具变量组合对制度质量指数具有显著的联合预测力,Kleibergen-Paap rk Wald F = 19.86(临界值10,Stock & Yogo,2005),工具变量相关性满足要求。Hansen J过度识别检验结果不显著,chi^2(1) = 0.73,p = .394,无法拒绝工具变量联合外生的零假设(Hansen,1982),支持工具变量组合的有效性。2SLS估计结果显示,制度质量对人均GDP年均增长率具有显著的正向效应,b = 1.24(SE = 0.38),t(75) = 3.26,p = .002,95% CI [0.49,1.99],即制度质量指数每提升1个标准差,人均GDP年均增长率约上升1.24个百分点。

场景三:结果汇报表格格式

论文中通常以表格形式同时呈现OLS与2SLS结果作为对比,建议格式如下:

模型1(OLS)模型2(2SLS)模型3(2SLS稳健)
教育年限0.071*** (0.008)0.092*** (0.019)0.089*** (0.021)
工作经验0.034*** (0.005)0.031*** (0.006)0.031*** (0.006)
性别(女=1)-0.187*** (0.024)-0.194*** (0.027)-0.193*** (0.027)
常数项6.842*** (0.112)6.721*** (0.198)6.733*** (0.201)
N500500500
R^2.412.397.397
第一阶段F(KP)64.0364.03
Hansen J chi^2(p值)1.84(p = .399)
Wu-Hausman F(p值)11.43(p < .001)11.43(p < .001)

注:括号内为稳健标准误(HC2);* p < .05,** p < .01,***p < .001;2SLS估计使用父亲教育年限作为工具变量


六、在ChatSRS一句话获得规范2SLS报告

打开 chatsrs.com,上传数据后输入:

"对数据集做工具变量回归(2SLS),内生变量为edu_years,结果变量为log_wage,工具变量为father_edu,控制变量为experience和female;输出第一阶段F检验(Kleibergen-Paap rk Wald F)、Wu-Hausman内生性检验、若过度识别则做Hansen J检验;同时输出OLS对比结果;给出符合APA 7th格式的完整报告段落,包含所有检验统计量和系数解释。"

ChatSRS会自动调用iv_regression函数(R ivreg包 + lmtest/sandwich稳健SE),输出第一阶段和第二阶段完整结果,并生成可直接复制进论文的APA格式段落。

如需面板数据的IV估计(如面板2SLS或GMM-IV),在指令中注明"面板数据,个体固定效应",ChatSRS会切换到plm包的工具变量面板模型并调整报告格式。


七、方法章节标准描述

单个工具变量(恰好识别)方法章节模板

本研究采用两阶段最小二乘法(Two-Stage Least Squares, 2SLS)处理
[内生变量名]的内生性问题。以[工具变量名]作为[内生变量名]的工具变量,
该变量满足工具变量的两个核心条件:其一,[工具变量]与[内生变量]高度相关
(相关性条件),通过第一阶段F检验验证(F > 10,Stock & Yogo,2005);
其二,[工具变量]仅通过[内生变量]影响[结果变量],不直接影响[结果变量]
(外生性/排他性限制条件),该假设基于[理论依据]。
稳健标准误采用异方差稳健HC2估计,显著性水平设为alpha = .05。
统计分析使用ChatSRS(R ivreg引擎)完成。

多个工具变量(过度识别)方法章节模板

本研究采用两阶段最小二乘法(2SLS)估计[内生变量名]的因果效应,
以[工具变量1]和[工具变量2]共同作为工具变量。
在工具变量有效性验证方面:(1)相关性方面,使用Kleibergen-Paap rk Wald F
统计量(Kleibergen & Paap,2006)检验弱工具变量问题;(2)外生性方面,
由于工具变量数量([n_z]个)多于内生变量数量([n_d]个),
使用Hansen J统计量(Hansen,1982)进行过度识别检验,以联合检验
所有工具变量的外生性假设。内生性的存在性通过Wu-Hausman检验
(Hausman,1978)加以验证。所有标准误均为聚类稳健标准误,
按[聚类变量]聚类。

八、2SLS报告常见错误对照表

常见错误正确做法说明
只报告第二阶段结果,不报告第一阶段F必须报告第一阶段KP F统计量审稿人无法判断弱工具问题
用"通过弱工具检验"代替具体数值报告F = XX.XX(临界值XX)须给出可复核的统计量
过度识别但不做Hansen J若工具数 > 内生数,必须做J检验漏掉外生性检验
不报告Wu-Hausman检验建议汇报以说明IV必要性缺乏内生性证据
不对比OLS与2SLS系数在结果表格并列展示两种估计有助于显示偏误方向
第一阶段F用Cragg-Donald F(非稳健)使用KP rk Wald F(异方差稳健)Cragg-Donald仅在同方差下有效
2SLS系数R^2与OLS含义相同注明2SLS的R^2意义有限,不作为模型拟合依据2SLS最大化的目标不是R^2
置信区间未报告95% CI [XX, XX] 每个关键系数必报APA 7th要求区间估计
p值写p = .000改为p < .001.000是舍入假值

常见FAQ

Q:工具变量的"相关性"和"外生性"分别怎么在论文里说明?

A:两个条件在论文中的说明方式截然不同。相关性(工具变量与内生变量相关)用统计检验说明——第一阶段F检验通过即可;外生性(工具变量不直接影响结果变量,即排他性限制)无法用统计方法直接证明,只能依赖理论论证。方法章节必须用文字说明工具变量为什么满足排他性限制,即为什么Z只通过D影响Y,而不会绕过D直接影响Y。审稿人的核心质疑往往在外生性上,而非弱工具检验。

Q:恰好识别的情况下,为什么不能做过度识别检验?

A:过度识别检验(Sargan/Hansen J)的逻辑是:若有多余工具变量,可以把其中一部分当作"内部标准"来验证其余工具变量的外生性。当工具变量数量恰好等于内生变量数量时(恰好识别),没有多余信息可用,所有工具变量的外生性都无法被检验,自由度为0。此时只能依靠理论论证工具变量的外生性,并在方法章节写明无法进行过度识别检验的原因("本研究为恰好识别模型,无法进行Hansen J检验,工具变量外生性依赖理论假设")。

Q:2SLS估计的R^2为什么有时是负值,报告时怎么处理?

A:2SLS最大化的目标函数不是平方和,其R^2在技术上是"伪R^2",没有OLS的R^2那样"解释方差比例"的含义,甚至可能为负(当2SLS拟合比仅用均值预测还差时)。APA格式处理建议:(1)在结果表格中仍可汇报R^2数值,但在注释中说明"2SLS的R^2不具备方差解释比例的含义";(2)不以R^2作为模型优劣的判断依据;(3)模型识别力依赖第一阶段F检验和理论逻辑,而非R^2大小。

Q:2SLS系数解释和OLS系数有区别吗?

A:有重要的语义区别。OLS系数是相关系数(关联效应),2SLS系数是局部平均处理效应(LATE, Local Average Treatment Effect)——准确来说,是工具变量影响范围内的因果效应,即仅对"工具变量改变了其行为的那部分人"(compliers)成立。在报告2SLS系数时,建议在论文中说明这一局限性:例如"本研究的IV估计为局部平均处理效应(LATE),结果的外推性受限于工具变量的影响范围"。如果追求总体平均处理效应(ATE),需要满足额外假设(如单调性 + 排他性 + 独立性全部成立且无违反协议者)。


快速参考:2SLS报告格式速查卡

[第一阶段 — 必报]
工具变量对内生变量回归:
b = X.XX, SE = X.XX, t([df]) = X.XX, p [值]
Kleibergen-Paap rk Wald F = XX.XX(临界值10,Stock & Yogo,2005)

[内生性检验 — 推荐报告]
Wu-Hausman F(1, [df]) = X.XX, p = .XXX
(p < .05 → 内生性成立,IV必要;p > .05 → OLS可能一致)

[过度识别检验 — 工具数>内生数时必报]
Hansen J chi^2([工具数-内生数]) = X.XX, p = .XXX
(p > .05 → 不拒绝联合外生,支持有效性)

[第二阶段系数 — 核心结果]
b = X.XX(SE = X.XX),t([df]) = X.XX, p [值],95% CI [XX, XX]
注:系数为未标准化,标准误为HC2稳健标准误

[精度规范]
系数保留两至三位小数
SE、置信区间边界保留两至三位小数
p值精确三位小数,不加前导零,p = .000改p < .001
F统计量保留两位小数

相关阅读


本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。