统计百科 ·
断点回归 RDD 怎么写进论文?带宽、断点跳跃与 APA 报告模板
断点回归 RDD 结果怎么报告?本文从驱动变量、断点与带宽出发,说明局部线性跳跃系数的解释,提供可复现提示和 APA 模板,并列出操纵检验与带宽敏感性的能力边界。
断点回归的核心不是“处理组和对照组做一次回归”,而是围绕一个明确阈值,比较驱动变量刚好落在阈值两侧的观测。论文必须让读者看清:阈值是谁制定的、处理状态如何由阈值决定、使用什么带宽,以及断点附近的局部跳跃是否可信。
报告前先核对识别设计
一个可解释的 sharp RDD 至少需要:
- 连续或足够细的驱动变量;
- 预先存在、不可随结果调整的 cutoff;
- 断点右侧处理状态为 1、左侧为 0;
- 个体不能精确操纵驱动变量跨越阈值;
- 除处理状态外,其他决定因素在断点处连续;
- 断点两侧有足够局部样本。
估计程序运行成功,并不自动验证这些条件。
可复现的数据示例与输入提示
| 列名 | 含义 |
|---|---|
| outcome | 结果变量 Y |
| score | 驱动变量 |
| eligible | 处理指示,score ≥ cutoff 时为 1 |
假设政策资格线是 60 分,分析带宽为 10 分,可提交:
对 outcome 做 sharp RDD。score 是驱动变量,cutoff 为 60,eligible 是处理指示且断点右侧为 1,主分析带宽 h=10。请报告局部线性模型中断点右侧处理系数、HC1 稳健 SE、显著性星号、带宽内 N 及左右样本数。当前直出表不展示精确 p 或 95% CI;如论文需要,须基于同一 HC1 结果另行计算并验证。若没有密度操纵检验、协变量连续性检查或多带宽敏感性结果,请明确标为未完成,不要虚构。
输入前应交叉检查 eligible 与 score ≥ 60 的一致性。编码方向相反会翻转跳跃系数的方向。
ChatSRS 当前能力边界
当前 panel_rdd 分析器会:
- 将驱动变量减去 cutoff 进行中心化;
- 保留给定带宽内的观测;
- 估计含处理指示、中心化驱动变量及二者交互项的局部线性模型;
- 使用 HC1 稳健标准误;
- 输出断点跳跃系数、HC1 SE、显著性星号、带宽、总样本及左右样本数;
- 在可选 rdrobust 依赖可用时,附加 MSE 带宽参考。
**能力边界:**基础结果是给定带宽下的局部线性 HC1 估计。直出 Markdown 表仅显示 b、HC1 SE 和显著性星号,不显示精确 p 或 95% CI;二者需另行计算并验证。当前结果也不能宣称已自动完成驱动变量密度操纵检验、协变量连续性检验、安慰剂断点或多带宽敏感性。若数据呈 fuzzy RDD 特征,当前方法仍按 sharp RDD 处理,不能当作完整模糊断点估计。
输出结果怎么解释
| 输出项 | 解释 |
|---|---|
| 处理(断点右侧)系数 | 在所选带宽和函数形式下,断点处结果变量的局部跳跃 |
| HC1 SE 与显著性星号 | 当前直出对该局部跳跃不确定性和阈值水平的呈现 |
| 精确 p 与 95% CI | 当前直出不展示;须基于同一估计结果另算并验证 |
| 驱动变量项 | 断点左侧的局部斜率组成 |
| 处理 × 驱动变量 | 断点两侧斜率差 |
| 左右样本数 | 局部支持度与不平衡程度 |
| rdrobust 参考 | 可选依赖运行成功时的升级参考,不应与主结果静默混用 |
只有在连续性、不可操纵等识别假设合理时,断点跳跃才可谨慎解释为 cutoff 附近的局部处理效应,而不是对所有样本的平均效应。
APA 三线表模板
| 变量 | b | HC1 SE | 显著性星号 | 95% CI(另算并验证) |
|---|---|---|---|---|
| 断点右侧处理 | [ ] | [ ] | [ ] | [[ ], [ ]] |
| 中心化驱动变量 | [ ] | [ ] | [ ] | [[ ], [ ]] |
| 处理 × 驱动变量 | [ ] | [ ] | [ ] | [[ ], [ ]] |
| 带宽 h | [ ] | |||
| 左侧 / 右侧 N | [ ] / [ ] |
表注建议:
注:驱动变量以 cutoff = [ ] 中心化,主结果使用带宽 h = [ ] 的局部线性回归和 HC1 稳健标准误。“断点右侧处理”系数为阈值处跳跃。直出表仅提供显著性星号,不显示精确 p 或 95% CI;表中的 CI 只可在基于同一 HC1 结果另行计算并验证后填写。密度操纵、协变量连续性和带宽敏感性结果如未完成,不在本表中推定。
APA 正文报告模板
本研究利用 [规则] 在驱动变量 [score] = [cutoff] 处形成的阈值,
估计 sharp RDD。主模型使用带宽 h = [ ] 的局部线性规格,
并采用 HC1 稳健标准误。带宽内共有 N = [ ] 个观测,
断点左侧 [ ] 个、右侧 [ ] 个。
断点处的结果变量跳跃为 b = [ ](HC1 SE = [ ],
[星号/显著性阈值])。[如已基于同一结果另算并验证,可补写
精确 p = [ ],95% CI [[ ], [ ]]。] 在断点附近连续性和不可操纵假设合理的前提下,
该系数可解释为 cutoff 附近的局部处理效应。当前基础输出未包含
密度操纵、协变量连续性及多带宽稳健性检验,因此不将该估计
外推至远离断点的总体。
常见问题 FAQ
Q1:为什么必须报告带宽?
RDD 的估计对象由断点附近样本定义。带宽改变会改变偏差、方差和实际进入估计的样本。
Q2:断点右侧变量可以编码为 0 吗?
当前实现要求右侧为 1。若编码反向,系数方向会反转,并可能触发一致性错误。
Q3:显著性星号或另算的 p 值能替代操纵检验吗?
不能。显著性只针对模型中的跳跃,不验证个体是否操纵驱动变量,也不验证协变量连续。
Q4:RDD 结果能代表全部样本吗?
通常不能。其解释对象是 cutoff 附近观测,外推需要额外假设和证据。
相关阅读
核对阈值规则和处理编码后,可打开 ChatSRS,按本文提示提交 RDD 分析。请把未完成的识别诊断如实列为局限。