统计百科 ·

断点回归 RDD 怎么写进论文?带宽、断点跳跃与 APA 报告模板

断点回归 RDD 结果怎么报告?本文从驱动变量、断点与带宽出发,说明局部线性跳跃系数的解释,提供可复现提示和 APA 模板,并列出操纵检验与带宽敏感性的能力边界。

断点回归的核心不是“处理组和对照组做一次回归”,而是围绕一个明确阈值,比较驱动变量刚好落在阈值两侧的观测。论文必须让读者看清:阈值是谁制定的、处理状态如何由阈值决定、使用什么带宽,以及断点附近的局部跳跃是否可信。

报告前先核对识别设计

一个可解释的 sharp RDD 至少需要:

  • 连续或足够细的驱动变量;
  • 预先存在、不可随结果调整的 cutoff;
  • 断点右侧处理状态为 1、左侧为 0;
  • 个体不能精确操纵驱动变量跨越阈值;
  • 除处理状态外,其他决定因素在断点处连续;
  • 断点两侧有足够局部样本。

估计程序运行成功,并不自动验证这些条件。

可复现的数据示例与输入提示

列名含义
outcome结果变量 Y
score驱动变量
eligible处理指示,score ≥ cutoff 时为 1

假设政策资格线是 60 分,分析带宽为 10 分,可提交:

对 outcome 做 sharp RDD。score 是驱动变量,cutoff 为 60,eligible 是处理指示且断点右侧为 1,主分析带宽 h=10。请报告局部线性模型中断点右侧处理系数、HC1 稳健 SE、显著性星号、带宽内 N 及左右样本数。当前直出表不展示精确 p 或 95% CI;如论文需要,须基于同一 HC1 结果另行计算并验证。若没有密度操纵检验、协变量连续性检查或多带宽敏感性结果,请明确标为未完成,不要虚构。

输入前应交叉检查 eligible 与 score ≥ 60 的一致性。编码方向相反会翻转跳跃系数的方向。

ChatSRS 当前能力边界

当前 panel_rdd 分析器会:

  • 将驱动变量减去 cutoff 进行中心化;
  • 保留给定带宽内的观测;
  • 估计含处理指示、中心化驱动变量及二者交互项的局部线性模型;
  • 使用 HC1 稳健标准误;
  • 输出断点跳跃系数、HC1 SE、显著性星号、带宽、总样本及左右样本数;
  • 在可选 rdrobust 依赖可用时,附加 MSE 带宽参考。

**能力边界:**基础结果是给定带宽下的局部线性 HC1 估计。直出 Markdown 表仅显示 b、HC1 SE 和显著性星号,不显示精确 p 或 95% CI;二者需另行计算并验证。当前结果也不能宣称已自动完成驱动变量密度操纵检验、协变量连续性检验、安慰剂断点或多带宽敏感性。若数据呈 fuzzy RDD 特征,当前方法仍按 sharp RDD 处理,不能当作完整模糊断点估计。

输出结果怎么解释

输出项解释
处理(断点右侧)系数在所选带宽和函数形式下,断点处结果变量的局部跳跃
HC1 SE 与显著性星号当前直出对该局部跳跃不确定性和阈值水平的呈现
精确 p 与 95% CI当前直出不展示;须基于同一估计结果另算并验证
驱动变量项断点左侧的局部斜率组成
处理 × 驱动变量断点两侧斜率差
左右样本数局部支持度与不平衡程度
rdrobust 参考可选依赖运行成功时的升级参考,不应与主结果静默混用

只有在连续性、不可操纵等识别假设合理时,断点跳跃才可谨慎解释为 cutoff 附近的局部处理效应,而不是对所有样本的平均效应。

APA 三线表模板

变量bHC1 SE显著性星号95% CI(另算并验证)
断点右侧处理[ ][ ][ ][[ ], [ ]]
中心化驱动变量[ ][ ][ ][[ ], [ ]]
处理 × 驱动变量[ ][ ][ ][[ ], [ ]]
带宽 h[ ]
左侧 / 右侧 N[ ] / [ ]

表注建议:

注:驱动变量以 cutoff = [ ] 中心化,主结果使用带宽 h = [ ] 的局部线性回归和 HC1 稳健标准误。“断点右侧处理”系数为阈值处跳跃。直出表仅提供显著性星号,不显示精确 p 或 95% CI;表中的 CI 只可在基于同一 HC1 结果另行计算并验证后填写。密度操纵、协变量连续性和带宽敏感性结果如未完成,不在本表中推定。

APA 正文报告模板

本研究利用 [规则] 在驱动变量 [score] = [cutoff] 处形成的阈值,
估计 sharp RDD。主模型使用带宽 h = [ ] 的局部线性规格,
并采用 HC1 稳健标准误。带宽内共有 N = [ ] 个观测,
断点左侧 [ ] 个、右侧 [ ] 个。

断点处的结果变量跳跃为 b = [ ](HC1 SE = [ ],
[星号/显著性阈值])。[如已基于同一结果另算并验证,可补写
精确 p = [ ],95% CI [[ ], [ ]]。] 在断点附近连续性和不可操纵假设合理的前提下,
该系数可解释为 cutoff 附近的局部处理效应。当前基础输出未包含
密度操纵、协变量连续性及多带宽稳健性检验,因此不将该估计
外推至远离断点的总体。

常见问题 FAQ

Q1:为什么必须报告带宽?

RDD 的估计对象由断点附近样本定义。带宽改变会改变偏差、方差和实际进入估计的样本。

Q2:断点右侧变量可以编码为 0 吗?

当前实现要求右侧为 1。若编码反向,系数方向会反转,并可能触发一致性错误。

Q3:显著性星号或另算的 p 值能替代操纵检验吗?

不能。显著性只针对模型中的跳跃,不验证个体是否操纵驱动变量,也不验证协变量连续。

Q4:RDD 结果能代表全部样本吗?

通常不能。其解释对象是 cutoff 附近观测,外推需要额外假设和证据。

相关阅读

核对阈值规则和处理编码后,可打开 ChatSRS,按本文提示提交 RDD 分析。请把未完成的识别诊断如实列为局限。