统计百科 ·
工具变量回归2SLS的APA报告怎么写?弱工具与过度识别检验格式全解
统计百科:专攻工具变量回归(2SLS)的APA 7th报告格式——第一阶段F检验弱工具判断、Sargan/Hansen过度识别检验写法、2SLS系数报告模板、方法章节标准描述,给出可直接套进论文的完整APA示例句式。
2SLS(两阶段最小二乘法)是处理内生性问题的核心工具,但它的APA报告格式在教材里几乎找不到——第一阶段F值写哪里、弱工具如何表述、过度识别检验怎么配合正文、系数要写几位小数……这篇文章专攻"工具变量回归结果怎么规范写进论文",给出APA 7th所有2SLS场景的完整模板,并逐一盘点审稿人最常挑的格式问题。
你的2SLS报告有这些问题吗?
审稿人或导师关于工具变量报告最常见的反馈:
- "第一阶段F检验结果没有报告,无法判断工具变量强度"
- "仅写'通过弱工具检验',请给出F统计量和临界值依据"
- "过度识别检验未报告,reviewer要求补充Sargan或Hansen J检验"
- "2SLS系数没有说明是经内生性校正后的估计,请在方法章节注明"
- "工具变量有效性的理论论证缺失,统计检验不能代替理论说明"
- "只报告了2SLS结果,建议同时报告OLS结果作为对比"
这些问题集中反映了一个事实:2SLS的APA报告不只是"把系数填进表格",还需要清楚展示内生性识别策略的可信度。本文只讲一件事:工具变量回归结果到底怎么规范写进论文的每一个位置。
如果你还没看过姊妹篇 面板数据回归的APA报告写法,建议先读那篇,本文默认你已了解回归系数、标准误、p值不加前导零(.032而非0.032)等基础格式规则,不再重复。
一、为什么2SLS报告比OLS更复杂
内生性与识别策略
普通OLS回归报告相对简单:给出系数beta、标准误SE、t值、p值,加上模型整体F检验和R^2即可。
2SLS之所以复杂,在于它要多回答三个问题:
- 工具变量够强吗?(弱工具变量检验,First-stage F test)
- 工具变量外生吗?(过度识别检验,仅在工具数量 > 内生变量数量时可检验)
- 内生性真的存在吗?(Hausman/Wu-Hausman内生性检验)
这三个检验的结果都需要在论文中汇报,缺一不可。APA 7th没有专门的2SLS格式章节,但其推断统计报告的通用原则(精确统计量 + 效应量 + 可重复性)同样适用。
2SLS的两阶段逻辑
第一阶段(First Stage):用工具变量Z(和其他外生控制变量X)对内生变量D进行OLS回归,获得D的拟合值 D_hat。
$D = \pi_0 + \pi_1 Z + \pi_2 X + v$
第二阶段(Second Stage):用拟合值 D_hat 替代原始D,对结果变量Y进行回归。
$Y = \beta_0 + \beta_1 \hat{D} + \beta_2 X + \varepsilon$
最终报告的 beta_1 即为经内生性校正的因果效应估计。
二、第一阶段F检验:弱工具变量的判断与报告格式
为什么F检验是2SLS报告的必报项
第一阶段F检验检验的是工具变量对内生变量的预测力(相关性条件)。若F值过低,工具变量为"弱工具变量"(Weak Instrument),2SLS估计会出现严重偏差(接近OLS偏差),标准误膨胀,推断失效。
临界值标准
| 判断标准 | 来源 | 说明 |
|---|---|---|
| F > 10(单个工具变量) | Staiger & Stock(1997) | 经典经验法则,单个内生变量 + 单个工具变量 |
| F > 10(多个工具变量) | Stock & Yogo(2005) | 允许5%最大bias时的近似门槛 |
| Effective F(KP rk Wald F) | Kleibergen-Paap(2006) | 异方差/聚类SE下的稳健F统计量,推荐使用 |
| F > 16.38(单变量单工具,size扭曲≤10%) | Stock & Yogo(2005)精确临界值 | 最大size扭曲10%对应16.38;最大相对bias 5%对应24.58 |
现代计量实践推荐使用Kleibergen-Paap rk Wald F统计量(简称KP F或rk F),因为它在异方差和聚类标准误下仍有效,而传统Cragg-Donald F仅在同方差下精确。
APA格式:第一阶段F检验的报告句式
嵌入正文段落时:
第一阶段回归结果显示,[工具变量名]对[内生变量名]具有显著的预测作用,
Kleibergen-Paap rk Wald F = XX.XX(临界值 10,Staiger & Stock,1997),
满足工具变量相关性要求,不存在弱工具变量问题。
填入数值的示例:
第一阶段回归结果显示,省级降雨量对农业机械化率具有显著的预测作用,Kleibergen-Paap rk Wald F = 34.27(临界值10,Staiger & Stock,1997),远超弱工具变量经验门槛,满足工具变量相关性要求。
若F偏低,需说明处理方式:
第一阶段Kleibergen-Paap rk Wald F = 7.82,低于Stock & Yogo(2005)弱工具临界值。为此,本研究同时报告了Anderson-Rubin置信集(AR CI)以获得在弱工具条件下稳健的推断,并汇报了LIML(有限信息最大似然)估计作为稳健性检验。
三、过度识别检验:Sargan/Hansen J检验的格式
什么时候需要过度识别检验
- 恰好识别(工具变量数 = 内生变量数):无法检验外生性,只能依赖理论论证。
- 过度识别(工具变量数 > 内生变量数):可以用Sargan检验(同方差下)或Hansen J检验(异方差稳健)检验工具变量外生性的联合假设。
过度识别检验的零假设是:所有工具变量均外生(与残差不相关)。因此:
- p > .05(不显著):无法拒绝外生性假设,支持工具变量的有效性
- p < .05(显著):至少有一个工具变量可能不满足外生性,需进一步说明
注意:过度识别检验不能直接"证明"工具变量外生——它只能在所有工具变量中至少有一个确实外生的前提下,联合检验其余工具变量的外生性。理论论证永远优先于统计检验。
APA格式:过度识别检验的报告句式
检验通过(p > .05):
Hansen J过度识别检验结果不显著,chi^2([工具数-内生数]) = X.XX, p = .XXX,
无法拒绝所有工具变量联合外生的零假设,支持工具变量组合的有效性。
填入数值的示例:
Hansen J过度识别检验结果不显著,chi^2(2) = 1.84,p = .399,无法拒绝所有工具变量联合外生的零假设(Sargan,1958;Hansen,1982),支持本研究工具变量组合的有效性。
检验未通过(p < .05):
Hansen J过度识别检验结果显著,chi^2(2) = 6.31,p = .043,提示工具变量组合的联合外生性存疑。本研究进一步对每个工具变量进行分类讨论,并报告了仅使用第一个工具变量的恰好识别估计(点估计 beta = 0.32,SE = 0.07)作为稳健性检验,估计结果基本稳定。
四、Wu-Hausman内生性检验的格式
内生性检验用于判断是否真正需要使用IV(若OLS一致,则无需IV)。零假设是:内生变量实际上外生,OLS与2SLS无显著差异。
零假设不成立(需要IV):
Wu-Hausman内生性检验结果显著,F(1, [df]) = X.XX, p = .XXX,
拒绝[内生变量名]外生的零假设,证实存在内生性问题,
使用2SLS估计具有必要性。
填入数值的示例:
Wu-Hausman内生性检验结果显著,F(1, 342) = 9.74,p = .002,拒绝教育年限外生的零假设,证实存在内生性问题,OLS估计不一致,使用2SLS估计具有必要性(Hausman,1978)。
五、2SLS系数的完整APA报告模板
必报要素清单
| 要素 | 格式 | 示例 |
|---|---|---|
| 2SLS系数(beta) | b = X.XX 或 beta = X.XX | b = 0.41 |
| 稳健标准误 | SE = X.XX | SE = 0.09 |
| t值或z值 | t(df) = X.XX | t(342) = 4.56 |
| p值(精确三位小数) | p = .XXX 或 p < .001 | p < .001 |
| 95%置信区间 | 95% CI [XX, XX] | 95% CI [0.23, 0.59] |
| 第一阶段F(必报) | KP F = XX.XX | KP F = 34.27 |
| 过度识别检验(若过度识别) | Hansen J chi^2(df) = X.XX, p = .XXX | Hansen J chi^2(2) = 1.84, p = .399 |
| 内生性检验(推荐) | Wu-Hausman F(1, df) = X.XX, p = .XXX | Wu-Hausman F(1, 342) = 9.74, p = .002 |
场景一:单个内生变量 + 单个工具变量(恰好识别)
情形:研究教育年限(内生)对工资的影响,以父亲教育年限为工具变量,控制经验、性别,N = 500。
完整报告段落模板:
采用两阶段最小二乘法(2SLS)估计[内生变量]对[因变量]的因果效应,
以[工具变量名]作为[内生变量名]的工具变量。
第一阶段结果显示,[工具变量]对[内生变量]具有显著的正向预测作用,
b = X.XX, SE = X.XX, t([df]) = X.XX, p [值],
Kleibergen-Paap rk Wald F = XX.XX,满足工具变量相关性要求(Stock & Yogo,2005)。
Wu-Hausman内生性检验结果显著,F(1, [df]) = X.XX, p [值],
证实[内生变量名]存在内生性,2SLS估计具有必要性。
2SLS第二阶段结果显示,在控制[控制变量列表]后,
[内生变量名]对[因变量名]具有显著的[正向/负向]效应,
b = X.XX(SE = X.XX),t([df]) = X.XX, p [值],95% CI [XX, XX]。
本研究使用HC2稳健标准误以应对异方差,所有报告系数均为未标准化系数。
填入数值的示例:
采用两阶段最小二乘法(2SLS)估计教育年限对月工资对数的因果效应,以父亲教育年限作为教育年限的工具变量(Card,1995)。第一阶段结果显示,父亲教育年限对子女教育年限具有显著的正向预测作用,b = 0.32,SE = 0.04,t(496) = 8.00,p < .001,Kleibergen-Paap rk Wald F = 64.03,远超弱工具临界值10(Stock & Yogo,2005),工具变量相关性满足要求。Wu-Hausman内生性检验结果显著,F(1, 495) = 11.43,p < .001,证实教育年限存在内生性,OLS估计不一致,2SLS估计具有必要性。2SLS第二阶段结果显示,在控制工作经验年限和性别后,教育年限对月工资对数具有显著的正向效应,b = 0.092,SE = 0.019,t(496) = 4.84,p < .001,95% CI [0.055,0.129],即每增加1年教育,月工资约提升9.2%(经内生性校正)。相比之下,OLS估计为b = 0.071(SE = 0.008),低于2SLS估计,符合正向选择偏误的理论预期。本研究使用HC2稳健标准误以应对异方差,报告系数均为未标准化系数。
场景二:单个内生变量 + 多个工具变量(过度识别)
情形:研究制度质量(内生)对经济增长的影响,以地理纬度和殖民地历史为工具变量,N = 80个国家。
完整报告段落模板(含过度识别检验):
采用两阶段最小二乘法(2SLS)估计[内生变量]对[因变量]的效应,
以[工具变量1]和[工具变量2]共同作为[内生变量名]的工具变量。
第一阶段中,工具变量组合对[内生变量名]具有显著的联合预测力,
Kleibergen-Paap rk Wald F = XX.XX(临界值10,Stock & Yogo,2005)。
Hansen J过度识别检验结果不显著,chi^2(1) = X.XX, p = .XXX,
支持工具变量组合的联合外生性。
2SLS估计结果显示,[内生变量名]对[因变量名]的效应为
b = X.XX(SE = X.XX),p [值],95% CI [XX, XX]。
填入数值的示例:
采用两阶段最小二乘法(2SLS)估计制度质量对人均GDP增长的因果效应,以绝对纬度和欧洲殖民者定居率(对数)共同作为制度质量的工具变量(Acemoglu等,2001)。第一阶段中,工具变量组合对制度质量指数具有显著的联合预测力,Kleibergen-Paap rk Wald F = 19.86(临界值10,Stock & Yogo,2005),工具变量相关性满足要求。Hansen J过度识别检验结果不显著,chi^2(1) = 0.73,p = .394,无法拒绝工具变量联合外生的零假设(Hansen,1982),支持工具变量组合的有效性。2SLS估计结果显示,制度质量对人均GDP年均增长率具有显著的正向效应,b = 1.24(SE = 0.38),t(75) = 3.26,p = .002,95% CI [0.49,1.99],即制度质量指数每提升1个标准差,人均GDP年均增长率约上升1.24个百分点。
场景三:结果汇报表格格式
论文中通常以表格形式同时呈现OLS与2SLS结果作为对比,建议格式如下:
| 模型1(OLS) | 模型2(2SLS) | 模型3(2SLS稳健) | |
|---|---|---|---|
| 教育年限 | 0.071*** (0.008) | 0.092*** (0.019) | 0.089*** (0.021) |
| 工作经验 | 0.034*** (0.005) | 0.031*** (0.006) | 0.031*** (0.006) |
| 性别(女=1) | -0.187*** (0.024) | -0.194*** (0.027) | -0.193*** (0.027) |
| 常数项 | 6.842*** (0.112) | 6.721*** (0.198) | 6.733*** (0.201) |
| N | 500 | 500 | 500 |
| R^2 | .412 | .397 | .397 |
| 第一阶段F(KP) | — | 64.03 | 64.03 |
| Hansen J chi^2(p值) | — | — | 1.84(p = .399) |
| Wu-Hausman F(p值) | — | 11.43(p < .001) | 11.43(p < .001) |
注:括号内为稳健标准误(HC2);* p < .05,** p < .01,***p < .001;2SLS估计使用父亲教育年限作为工具变量
六、在ChatSRS一句话获得规范2SLS报告
打开 chatsrs.com,上传数据后输入:
"对数据集做工具变量回归(2SLS),内生变量为edu_years,结果变量为log_wage,工具变量为father_edu,控制变量为experience和female;输出第一阶段F检验(Kleibergen-Paap rk Wald F)、Wu-Hausman内生性检验、若过度识别则做Hansen J检验;同时输出OLS对比结果;给出符合APA 7th格式的完整报告段落,包含所有检验统计量和系数解释。"
ChatSRS会自动调用iv_regression函数(R ivreg包 + lmtest/sandwich稳健SE),输出第一阶段和第二阶段完整结果,并生成可直接复制进论文的APA格式段落。
如需面板数据的IV估计(如面板2SLS或GMM-IV),在指令中注明"面板数据,个体固定效应",ChatSRS会切换到plm包的工具变量面板模型并调整报告格式。
七、方法章节标准描述
单个工具变量(恰好识别)方法章节模板
本研究采用两阶段最小二乘法(Two-Stage Least Squares, 2SLS)处理
[内生变量名]的内生性问题。以[工具变量名]作为[内生变量名]的工具变量,
该变量满足工具变量的两个核心条件:其一,[工具变量]与[内生变量]高度相关
(相关性条件),通过第一阶段F检验验证(F > 10,Stock & Yogo,2005);
其二,[工具变量]仅通过[内生变量]影响[结果变量],不直接影响[结果变量]
(外生性/排他性限制条件),该假设基于[理论依据]。
稳健标准误采用异方差稳健HC2估计,显著性水平设为alpha = .05。
统计分析使用ChatSRS(R ivreg引擎)完成。
多个工具变量(过度识别)方法章节模板
本研究采用两阶段最小二乘法(2SLS)估计[内生变量名]的因果效应,
以[工具变量1]和[工具变量2]共同作为工具变量。
在工具变量有效性验证方面:(1)相关性方面,使用Kleibergen-Paap rk Wald F
统计量(Kleibergen & Paap,2006)检验弱工具变量问题;(2)外生性方面,
由于工具变量数量([n_z]个)多于内生变量数量([n_d]个),
使用Hansen J统计量(Hansen,1982)进行过度识别检验,以联合检验
所有工具变量的外生性假设。内生性的存在性通过Wu-Hausman检验
(Hausman,1978)加以验证。所有标准误均为聚类稳健标准误,
按[聚类变量]聚类。
八、2SLS报告常见错误对照表
| 常见错误 | 正确做法 | 说明 |
|---|---|---|
| 只报告第二阶段结果,不报告第一阶段F | 必须报告第一阶段KP F统计量 | 审稿人无法判断弱工具问题 |
| 用"通过弱工具检验"代替具体数值 | 报告F = XX.XX(临界值XX) | 须给出可复核的统计量 |
| 过度识别但不做Hansen J | 若工具数 > 内生数,必须做J检验 | 漏掉外生性检验 |
| 不报告Wu-Hausman检验 | 建议汇报以说明IV必要性 | 缺乏内生性证据 |
| 不对比OLS与2SLS系数 | 在结果表格并列展示两种估计 | 有助于显示偏误方向 |
| 第一阶段F用Cragg-Donald F(非稳健) | 使用KP rk Wald F(异方差稳健) | Cragg-Donald仅在同方差下有效 |
| 2SLS系数R^2与OLS含义相同 | 注明2SLS的R^2意义有限,不作为模型拟合依据 | 2SLS最大化的目标不是R^2 |
| 置信区间未报告 | 95% CI [XX, XX] 每个关键系数必报 | APA 7th要求区间估计 |
| p值写p = .000 | 改为p < .001 | .000是舍入假值 |
常见FAQ
Q:工具变量的"相关性"和"外生性"分别怎么在论文里说明?
A:两个条件在论文中的说明方式截然不同。相关性(工具变量与内生变量相关)用统计检验说明——第一阶段F检验通过即可;外生性(工具变量不直接影响结果变量,即排他性限制)无法用统计方法直接证明,只能依赖理论论证。方法章节必须用文字说明工具变量为什么满足排他性限制,即为什么Z只通过D影响Y,而不会绕过D直接影响Y。审稿人的核心质疑往往在外生性上,而非弱工具检验。
Q:恰好识别的情况下,为什么不能做过度识别检验?
A:过度识别检验(Sargan/Hansen J)的逻辑是:若有多余工具变量,可以把其中一部分当作"内部标准"来验证其余工具变量的外生性。当工具变量数量恰好等于内生变量数量时(恰好识别),没有多余信息可用,所有工具变量的外生性都无法被检验,自由度为0。此时只能依靠理论论证工具变量的外生性,并在方法章节写明无法进行过度识别检验的原因("本研究为恰好识别模型,无法进行Hansen J检验,工具变量外生性依赖理论假设")。
Q:2SLS估计的R^2为什么有时是负值,报告时怎么处理?
A:2SLS最大化的目标函数不是平方和,其R^2在技术上是"伪R^2",没有OLS的R^2那样"解释方差比例"的含义,甚至可能为负(当2SLS拟合比仅用均值预测还差时)。APA格式处理建议:(1)在结果表格中仍可汇报R^2数值,但在注释中说明"2SLS的R^2不具备方差解释比例的含义";(2)不以R^2作为模型优劣的判断依据;(3)模型识别力依赖第一阶段F检验和理论逻辑,而非R^2大小。
Q:2SLS系数解释和OLS系数有区别吗?
A:有重要的语义区别。OLS系数是相关系数(关联效应),2SLS系数是局部平均处理效应(LATE, Local Average Treatment Effect)——准确来说,是工具变量影响范围内的因果效应,即仅对"工具变量改变了其行为的那部分人"(compliers)成立。在报告2SLS系数时,建议在论文中说明这一局限性:例如"本研究的IV估计为局部平均处理效应(LATE),结果的外推性受限于工具变量的影响范围"。如果追求总体平均处理效应(ATE),需要满足额外假设(如单调性 + 排他性 + 独立性全部成立且无违反协议者)。
快速参考:2SLS报告格式速查卡
[第一阶段 — 必报]
工具变量对内生变量回归:
b = X.XX, SE = X.XX, t([df]) = X.XX, p [值]
Kleibergen-Paap rk Wald F = XX.XX(临界值10,Stock & Yogo,2005)
[内生性检验 — 推荐报告]
Wu-Hausman F(1, [df]) = X.XX, p = .XXX
(p < .05 → 内生性成立,IV必要;p > .05 → OLS可能一致)
[过度识别检验 — 工具数>内生数时必报]
Hansen J chi^2([工具数-内生数]) = X.XX, p = .XXX
(p > .05 → 不拒绝联合外生,支持有效性)
[第二阶段系数 — 核心结果]
b = X.XX(SE = X.XX),t([df]) = X.XX, p [值],95% CI [XX, XX]
注:系数为未标准化,标准误为HC2稳健标准误
[精度规范]
系数保留两至三位小数
SE、置信区间边界保留两至三位小数
p值精确三位小数,不加前导零,p = .000改p < .001
F统计量保留两位小数
相关阅读
本文首发于ChatSRS官方博客。如有问题或反馈,欢迎在ChatSRS站内 [用户中心 -> 帮助与反馈] 联系我们。