审稿返修 ·

审稿人质疑内生性:OLS、2SLS、弱工具诊断怎么补

审稿人质疑内生性怎么办?本文从反向因果、遗漏变量和测量误差分流,核对 OLS、2SLS、弱工具与系统 GMM 的真实输出,并提供返修信模板。

直接返修答案

不要先寻找一个能让结果继续显著的工具变量。先说明审稿人担心的内生性来源:反向因果、遗漏变量、样本选择、测量误差还是动态持续性。不同问题需要不同设计;2SLS 只有在工具与内生变量相关、对结构误差外生、并满足排除限制时才有意义。

第一阶段 F 较大只提供相关性或弱工具风险信息,不能证明排除限制。Hansen 检验未拒绝也不能证明所有工具有效。任何工具变量都必须有时间顺序、制度背景和潜在直接路径的理论论证。

返修前先建立“质疑—设计—证据”表

质疑首先需要的证据不能只做什么
反向因果时间顺序、外生冲击或设计把 X 滞后一期就宣布解决
遗漏变量设计、固定效应、敏感性或可信 IV多加控制直到显著
测量误差测量验证、替代指标或 IV 逻辑只换变量名称
动态持续性明确动态模型和工具集合把系统 GMM 当万能按钮
样本选择选择机制与相应模型用 2SLS 代替选择模型

当前普通 iv_regression 的真实范围

iv_regression 当前输出 OLS 与手工两阶段结果对比:内生变量和控制变量的 B、星号、括号内 t、N、OLS R²,以及每个内生变量第一阶段模型的整体 F。

**严格边界:**第二阶段是把预测的内生变量放入普通 OLS,当前 t 值没有标准 2SLS 方差修正;第一阶段 F 是包含工具和控制的整体模型 F,不是排除工具的专门 partial F,也没有稳健/聚类 SE、CI、内生性检验或过度识别检验。因此这条路径只能作探索性对照,不能作为严格 IV 推断的终稿。

当前 panel_iv 的真实范围

panel_iv 当前只接受单一内生 X 与单一工具 Z,分别估计个体 FE-2SLS 和双向固定 FE-2SLS。它先用 pyhdfe 吸收固定效应,再调用 linearmodels.IV2SLS,按个体聚类标准误。当前 Markdown 对系数只直出 B、括号内聚类 SE 和由内部 p 转换的显著性星号,不直出系数精确 p;标量行还显示固定效应、聚类层级和 N。

**一阶段诊断边界:**当前 formatter 把一阶段标量行命名为“KP 弱工具 F”,但源码实际读取的是 linearmodels FirstStageResults.diagnosticsf.stat。在当前 cov_type="clustered" 下,该统计量使用 Wald 检验并服从 χ² 分布,不能称为已经验证的 Kleibergen–Paap F,也不能直接套用“F>10”。复核时必须从同一一阶段结果另行提取并保存 f.statf.dist,按实际分布写成“一阶段 Wald χ²(df)”;若论文要求真正的 Kleibergen–Paap 统计量,应转到明确实现并验证该诊断的工具。

**其他边界:**这是单内生、单工具规格,不能声称已做过度识别检验。cluster 参数不会改变当前个体聚类口径。工具和内生变量虽会先检查原始变异,但被固定效应吸收后仍可能识别不足并导致估计失败。任何一阶段相关性统计都不证明外生性或排除限制。

返修终稿仍应保存实际跑通的版本、命令和原始输出,并核对固定效应后的第一阶段支持。

当前 panel_gmm 不能替代任意 IV

panel_gmm 当前是两步系统 GMM 动态面板:把滞后一期 Y 放入方程,以 Y 的较深滞后构造 GMM 工具;核心 X 和控制变量在命令中作为普通 iv() 变量处理。Markdown 对系数直出 B、SE 与显著性星号,并另列 AR(1) p、AR(2) p、Hansen p、工具数和 N;不把系数内部 p 写成直出精确 p。

因此,当前路径并没有自动把被质疑的 X 当内生变量并为它寻找工具。只有研究问题本身是动态面板、X 的外生性设定可辩护、时间维度和个体数适合、工具数量受控时才考虑。AR(1)显著、AR(2)不显著和 Hansen 未拒绝只是诊断组合,不是识别保证。

可复核输入与执行要求

假设 firm_panel.csvfirm_idyearperformance、可能内生的 digital、候选工具 broadband_rollout 与控制变量。

可先提交探索性核查:

以 performance 为 Y、digital 为内生 X、broadband_rollout 为候选 Z,控制 size 和 leverage。先画出 Z→X→Y 与所有可能直接路径,说明 Z 的时间顺序和排除限制。普通 iv_regression 只报告 OLS/手工两阶段 B、t、N 和第一阶段整体 F,并明确 t 未做标准 2SLS 方差修正、F 不是排除工具 partial F;不得作为最终推断。

严格终稿应要求:

使用当前 panel_iv 的单内生、单工具 FE-2SLS 路径,按 Markdown 报告个体 FE 与双向固定 FE 两列的 B、个体聚类SE、显著性星号和 N,并明确没有系数精确 p、CI 或过度识别检验。对一阶段诊断,从同一结果另行提取 f.statf.dist;聚类协方差下按 Wald χ²(df) 命名,不称 KP F、不套 F>10。若需要真正的 Kleibergen–Paap、弱工具稳健区间、多工具或其他聚类层级,转到明确实现并验证这些字段的工具。

输出怎么解释

演示性的第一阶段整体 F=18 不能写成“工具变量有效”。它可能包含控制变量贡献,也无法检验 Z 是否通过其他路径影响 Y。工具系数的方向、制度冲击的覆盖范围和排除限制都要单独陈述。

如果严格 2SLS 与 OLS 不同,应比较估计对象、样本、权重和不确定性,而不是挑更显著的一个。若弱工具诊断不理想,应报告不确定性、考虑弱工具稳健推断或承认设计不足,不能临时添加工具直到过关。

返修证据包应包含什么

保存工具变量的制度来源、构造代码、时间覆盖、描述统计和第一阶段图表;逐条列出可能违反排除限制的通道及为什么可排除或无法排除。软件层面保存精确版本、估计命令、固定效应、聚类层级、工具集合、样本筛选和失败日志。一阶段统计必须连同名称、自由度和分布保存,不能把聚类 Wald χ²写成 F 或 KP。多工具或多内生变量时,更不能套用单工具阈值;弱工具稳健区间和过度识别检验应由匹配设计的实现给出。若任何关键路径尚未跑通,就在返修信中报告尚未完成,而不是引用计划中的表头。透明承认剩余内生性通常比堆叠未经验证的“检验”更有说服力。

返修信模板

感谢审稿人对内生性的提醒。我们将主要风险界定为 [反向因果/遗漏变量/测量误差]。
候选工具 [Z] 的相关性依据为 [ ],排除限制依据为 [制度与路径论证];
同时讨论了可能违反排除限制的路径 [ ]。
修订稿使用经验证的 [2SLS/其他设计]。当前 panel_iv Markdown 报告 B、聚类SE、星号和N;
一阶段另行绑定 f.stat=[ ]、f.dist=[ ],并按实际分布命名,不写成未经验证的KP F。
若需系数精确p、区间或真正Kleibergen–Paap统计量,由 [验证工具] 另行输出。
这些诊断不证明工具绝对外生,剩余限制已加入讨论。

常见问题 FAQ

Q1:panel_iv 表里标成“KP F”的值可以直接套 F>10 吗?

不能。底层读取的是 linearmodels 一阶段 f.stat;聚类协方差下其分布为 χ²。必须同时核对 f.dist 并按 Wald χ²命名,既不能直接套 F>10,也不能称为已经验证的 Kleibergen–Paap F。

Q2:可以为了显著临时找工具变量吗?

不可以。工具应由理论、制度与时间顺序事前支持。

Q3:当前 panel_iv 能报告哪些 IV 证据?

当前是单内生、单工具的个体 FE 与双向固定 FE 2SLS;Markdown 直出 B、个体聚类SE、显著性星号和 N,不直出系数精确 p 或 CI。一阶段表头命名不可靠,需另取 f.statf.dist,在聚类协方差下按 Wald χ²解释。

Q4:系统 GMM 能解决所有 X 内生性吗?

不能。当前实现主要为动态 Y 构造 GMM 工具,并把 X 当普通 IV 变量处理。

相关阅读

完成内生性来源与候选工具路径图后,可打开 ChatSRS,提交探索性 IV 诊断需求。严格返修结论只能引用真实跑通且方差正确的实现。