统计百科 ·

Heckman 两步法结果怎么报告?选择方程、IMR 与 APA 模板

Heckman 两步法怎么写进论文?本文说明选择方程、排除限制、逆米尔斯比 IMR 与结果方程的报告顺序,提供可复现提示和 APA 模板,并明确 IMR 显著不等于自动获得因果识别。

Heckman 两步法处理的是一种特定问题:结果变量只在被选择进入样本的观测中可见,而且这种选择可能不是随机的。它先用 Probit 选择方程估计进入样本的概率,再构造逆米尔斯比(IMR,常记为 λ),把 λ 放入结果方程修正选择机制。

如果研究没有明确“谁有机会进入结果样本”,就不应仅因为担心内生性而套用 Heckman。

先画清两条方程

选择方程回答:哪些观测被选入、结果变量可被观察?

结果方程回答:在被选入样本中,X 与 Y 的关系是什么?

高质量报告至少要说明:

  • 选择指示变量如何编码,1 与 0 各代表什么;
  • 选择方程使用哪些变量;
  • 哪个变量只进入选择方程、不进入结果方程,即排除限制;
  • 排除限制为什么有理论依据;
  • 结果方程报告哪些控制变量与标准误;
  • λ 的符号、SE、p 值如何解释。

可复现的数据示例与输入提示

列名含义
wage仅就业者可观测的结果 Y
education结果方程核心 X
selected是否就业且工资可观测,1=选入,0=未选入
local_jobs只进入选择方程的排除限制候选
age、experience两方程控制变量

可以提交:

使用 Heckman 两步法分析 education 与 wage。selected 是真实选择指示列,1 表示工资可观测、0 表示未选入;local_jobs 进入选择方程但排除在结果方程之外,age 和 experience 为控制变量。请报告第二步 education 的 b、HC1 SE 和显著性星号;报告 IMR λ 的 b、SE,以及表注中直出的精确 p;同时报告结果方程 N 和总样本量。核心 X 的精确 p 当前不直出,如论文需要必须另行取得并验证。请明确当前格式化输出不包含完整第一步 Probit 系数表,不要把 λ 显著解释为排除限制有效或因果识别成立。

local_jobs 只是示例列名。真实研究必须用理论和制度背景论证排除限制,不能照抄示例。

ChatSRS 当前能力边界

当前 panel_heckman 分析器支持两种选择机制:

  1. 推荐使用真实 0/1 选择指示列;
  2. 没有选择指示列时,可把 Y 是否可观测作为选择机制,但若 Y 完全无缺失会直接提示该路径不适用。

它先估计 Probit 选择方程并计算 IMR,再在被选入样本中估计含 λ 的 OLS 结果方程,结果方程使用 HC1 稳健标准误。格式化表对核心 X 与 λ 均显示 b、HC1 SE 和显著性星号;此外,表注单独显示 λ 的精确 p。核心 X 的精确 p 不在直出结果中。结果还列出结果方程样本量和总样本量。

**能力边界:**当前直出不展示完整第一步 Probit 系数表;核心 X 仅直出 b、HC1 SE 和星号,精确 p 需另行取得并验证;λ 的精确 p 则会出现在表注中。λ 显著最多说明在当前模型设定下选择修正项与结果相关,不证明排除限制有效,也不使观察性设计自动获得因果识别。两步估计的推断口径还应按目标期刊和研究设计复核。

输出结果怎么解释

输出项正确解释
X 的 b加入 λ 后,在结果方程中的条件系数
X 的 HC1 SE 与星号当前直出对核心 X 推断的呈现;精确 p 不直出
λ / IMR由第一步选择方程生成的修正项
λ 的精确 p直出表注中的数值,用于判断当前设定下修正项是否偏离零
结果方程 Nselected=1 且所需变量完整的观测数
总样本量用于说明选择前后的样本规模

λ 不显著也不等于“绝对没有选择偏差”;可能是选择方程识别弱、样本不足或排除限制不佳。λ 显著同样不能证明修正后的 X 就是因果效应。

APA 三线表模板

建议把第一步和第二步分栏;若当前直出缺少第一步系数,必须标明待补,而不是填写猜测值。

变量选择方程 Probit结果方程 b (HC1 SE)
排除限制 Z[经验证后填]
核心 X[若进入则填][ ]
控制变量[ ][ ]
IMR λ[ ]
N[ ][ ]

表注建议:

注:选择变量编码为 1=[选入含义]、0=[未选入含义]。Z 仅进入选择方程,其排除依据为 [理论或制度理由]。结果方程采用 HC1 稳健标准误。直出表对核心 X 仅显示星号,不显示精确 p;λ 的精确 p 位于表注。当前产品直出若未展示第一步 Probit 系数,需由经验证的补充输出填入。

APA 正文报告模板

为评估非随机样本选择,本研究采用 Heckman 两步法。第一步以
[selected] 为选择变量估计 Probit 模型,其中 1 表示 [ ],
0 表示 [ ];[Z] 作为排除限制进入选择方程但不进入结果方程,
理论依据为 [ ]。

第二步在被选入样本中估计 [Y] 的结果方程并加入逆米尔斯比 λ。
[X] 的系数为 b = [ ](HC1 SE = [ ],[星号/显著性阈值]);
[若已另行取得并验证,可补写 X 的精确 p = [ ]。]
λ = [ ](SE = [ ],表注精确 p = [ ])。结果方程 N = [ ],
选择前总样本量为 [ ]。

λ 的结果用于描述当前选择模型下的样本选择信号,不被解释为
排除限制已经验证,也不据此自动赋予 [X] 因果含义。

常见问题 FAQ

Q1:只要担心内生性就该用 Heckman 吗?

不是。Heckman 针对结果样本的非随机选择;反向因果、测量误差等问题需要其他设计。

Q2:一定要有排除限制吗?

从识别与说服力看,应有只影响选择、不直接影响结果的理论变量。仅依赖 Probit 非线性通常很弱。

Q3:IMR 显著说明修正成功了吗?

不说明。它提示选择项与结果相关,但模型设定、排除限制和估计不确定性仍需审查。

Q4:没有 selected 列怎么办?

当前实现可在 Y 存在选择性缺失时以“Y 是否可观测”构造选择机制;若 Y 无缺失,应使用真实选择指示,而不是人为制造缺失。

相关阅读

准备好选择机制与排除限制的理论说明后,可打开 ChatSRS,按本文提示提交 Heckman 两步分析。请把选择方程证据和因果边界一并保留。